{
 "generated_at": "2026-09-10T15:53:29+0800",
 "run": "raw/ledger_capture_480x832_v1",
 "wrappers": {
  "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py": 34,
  "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/cw/ccwokstugdakajls2ou4nhqbdahh3nr5p6xvlgctdptya2rrvlls.py": 34,
  "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py": 34,
  "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/m5/cm526uheaobxg5z6cx4qmdkv7oxg4coduexcqmnsadn6mmt7m5ar.py": 34,
  "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py": 34,
  "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/nh/cnh5novhuiqp3ug7b4754tkp6t423wnh6vrbte2htxkl33nh65xq.py": 34,
  "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py": 34,
  "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/7x/c7xkhlq66erha5wp4ivm7j4v76zv737pdp27rf67dhfixx7s6hic.py": 34
 },
 "summary": {
  "graphs": 160,
  "kernels": 6720,
  "unmatched_kernels": 0
 },
 "graphs": {
  "3168673:5": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:8": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:11": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:14": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:17": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:20": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:23": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:26": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:29": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:32": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:35": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:38": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:41": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:44": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:47": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:50": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:53": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:56": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:59": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:62": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:65": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:68": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:71": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:74": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:77": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:80": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:83": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:86": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:89": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:92": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:95": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:98": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:101": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:104": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:107": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:110": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:113": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:116": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:119": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168673:122": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168673-dfx4q4ou/inductor/7q/c7quojgc3bfxedcobdbdwcaabgfaafylb5qico2yzzp5u5dlafmq.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:5": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:8": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:11": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:14": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:17": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:20": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:23": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:26": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:29": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:32": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:35": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:38": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:41": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:44": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:47": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:50": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:53": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:56": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:59": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:62": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:65": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:68": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:71": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:74": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:77": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:80": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:83": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:86": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:89": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:92": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:95": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:98": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:101": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:104": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:107": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:110": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:113": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:116": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:119": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168674:122": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168674-oa8kyt85/inductor/jq/cjqqmvsm5ekrlo3bexl7jptqa7p7ooepa37bafo74e3ojvisceaz.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:5": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:8": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:11": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:14": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:17": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:20": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:23": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:26": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:29": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:32": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:35": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:38": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:41": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:44": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:47": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:50": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:53": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:56": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:59": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:62": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:65": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:68": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:71": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:74": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:77": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:80": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:83": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:86": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:89": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:92": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:95": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:98": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:101": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:104": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:107": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:110": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:113": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:116": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:119": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168675:122": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168675-kv1uwxjg/inductor/i7/ci7wbnuhylpfscny42hqloadef34tmmjiaxcfn7a7bwmqpaawlwi.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:5": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:8": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:11": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:14": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:17": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:20": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:23": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:26": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:29": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:32": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:35": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:38": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:41": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:44": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:47": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:50": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:53": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:56": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:59": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:62": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:65": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:68": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:71": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:74": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:77": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:80": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:83": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:86": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:89": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:92": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:95": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:98": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:101": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:104": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:107": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:110": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:113": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:116": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:119": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  },
  "3168676:122": {
   "wrapper": "compile_cache/lingbot-u4-2005-3168676-qqxe5byq/inductor/4j/c4jsji2q66e7hjib6vuqoxnrlj6md7xag2ipjm3pbpjzs7y32sbc.py",
   "kernels": 42,
   "unmatched": 0,
   "positions": [
    {
     "position": 0,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "item": 0,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_1",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1"
    },
    {
     "position": 1,
     "kernel": "nvjet_sm90_tst_256x152_64x4_1x2_h_bz_coopA_bias_TNT",
     "item": 1,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_1, modulation, chunk, float_2, layer_norm, scale_msa, add_1, mul, shift_msa, add_2, normalized_1, output_parallel"
    },
    {
     "position": 2,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "item": 2,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_2",
     "source_nodes": "output_parallel, split, value_float, pow_1, sum_of_squares, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 3,
     "kernel": "rotary_kernel",
     "item": 3,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float, truediv, rms, truediv_1, float_5, mul_1, query_1, query_2, triton_kernel_wrapper_mutation"
    },
    {
     "position": 4,
     "kernel": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "item": 4,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_div_mul_pow_split_with_sizes_sqrt_sum_view_3",
     "source_nodes": "output_parallel, split, value_float_1, pow_2, sum_of_squares_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 5,
     "kernel": "rotary_kernel",
     "item": 5,
     "kind": "triton",
     "op": "rotary_kernel_0",
     "source_nodes": "output_parallel, split, value_float_1, truediv_2, rms_1, truediv_3, float_7, mul_2, key_1, key_2, triton_kernel_wrapper_mutation_1"
    },
    {
     "position": 6,
     "kernel": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "item": 6,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_split_with_sizes_stack_transpose_view_4",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 7,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 7,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel, split, value_7, stack, reshape, transpose, input_t, tensor"
    },
    {
     "position": 8,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 9,
     "kernel": "void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 10,
     "kernel": "void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 11,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 12,
     "kernel": "void at::native::vectorized_gather_kernel<(int)16, long>(char *, char *, T2 *, i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 13,
     "kernel": "void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<i",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 14,
     "kernel": "void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unn",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 15,
     "kernel": "void flash::prepare_varlen_num_blocks_kernel<(int)1, (bool)0>(int, int, int, con",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 16,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 8,
     "kind": "custom",
     "op": "vllm_omni.ar_diffusion_paged_write_attn",
     "source_nodes": "ar_diffusion_paged_write_attn"
    },
    {
     "position": 17,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 9,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 18,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 11,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2"
    },
    {
     "position": 19,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 10,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_5, reshape_3, transpose_3, transpose_4, contiguous_7, tensor_1"
    },
    {
     "position": 20,
     "kernel": "triton_poi_fused_silu_view_6",
     "item": 12,
     "kind": "triton",
     "op": "triton_poi_fused_silu_view_6",
     "source_nodes": "output_parallel_2, input_parallel_1"
    },
    {
     "position": 21,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 13,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_2, input_parallel_1, output_parallel_3"
    },
    {
     "position": 22,
     "kernel": "triton_poi_fused_add_view_7",
     "item": 14,
     "kind": "triton",
     "op": "triton_poi_fused_add_view_7",
     "source_nodes": "output_parallel_3, camera_features"
    },
    {
     "position": 23,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 15,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_3, camera_features, camera_scale"
    },
    {
     "position": 24,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 16,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_8"
    },
    {
     "position": 25,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 17,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_8, input_parallel, output_parallel_1"
    },
    {
     "position": 26,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 18,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "camera_shift"
    },
    {
     "position": 27,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "item": 19,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_9",
     "source_nodes": "float_1, modulation, chunk, camera_scale, add_11, output_parallel_1, gate_msa, mul_6, add_9, hidden_states, mul_7, camera_shift, add_12, float_8, layer_norm_1, float_9, float_10, to_6"
    },
    {
     "position": 28,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 20,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "float_8, layer_norm_1, float_9, float_10, to_6, output_parallel_4"
    },
    {
     "position": 29,
     "kernel": "triton_red_fused__to_copy_pow_sum_view_10",
     "item": 21,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_pow_sum_view_10",
     "source_nodes": "output_parallel_4, value_float_2, pow_3, sum_of_squares_2"
    },
    {
     "position": 30,
     "kernel": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "item": 22,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_all_to_all_single_clone_div_mul_sqrt_transpose_view_11",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 31,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 23,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "output_parallel_4, value_float_2, truediv_4, rms_2, truediv_5, float_12, mul_8, query_4, query_5, reshape_7, transpose_6, input_t_2, tensor_2"
    },
    {
     "position": 32,
     "kernel": "void cutlass::device_kernel<flash::enable_sm90_or_later<flash::FlashAttnFwdSm90<",
     "item": 24,
     "kind": "custom",
     "op": "fa3_fwd._flash_attn_forward",
     "source_nodes": "_flash_attn_forward_default, key_4, value_9"
    },
    {
     "position": 33,
     "kernel": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "item": 25,
     "kind": "triton",
     "op": "triton_poi_fused_all_to_all_single_clone_transpose_unsqueeze_view_5",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 34,
     "kernel": "ncclDevKernel_SendRecv(ncclDevKernelArgsStorage<(unsigned long)4096>)",
     "item": 26,
     "kind": "custom",
     "op": "_c10d_functional.all_to_all_single",
     "source_nodes": "reshape_10, transpose_8, transpose_9, contiguous_11, tensor_3"
    },
    {
     "position": 35,
     "kernel": "triton_poi_fused_clone_transpose_view_8",
     "item": 27,
     "kind": "triton",
     "op": "triton_poi_fused_clone_transpose_view_8",
     "source_nodes": "contiguous_12"
    },
    {
     "position": 36,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 28,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "contiguous_12, input_parallel_2, output_parallel_5"
    },
    {
     "position": 37,
     "kernel": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "item": 29,
     "kind": "triton",
     "op": "triton_red_fused__to_copy_add_mul_native_layer_norm_split_squeeze_view_12",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, float_13, layer_norm_2, scale_ffn, add_15, mul_10, shift_ffn, add_16, normalized_3"
    },
    {
     "position": 38,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 30,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6"
    },
    {
     "position": 39,
     "kernel": "triton_poi_fused_gelu_view_13",
     "item": 31,
     "kind": "triton",
     "op": "triton_poi_fused_gelu_view_13",
     "source_nodes": "output_parallel_6, input_1"
    },
    {
     "position": 40,
     "kernel": "nvjet_sm90_tst_128x200_64x5_2x1_v_bz_coopA_bias_TNT",
     "item": 32,
     "kind": "extern",
     "op": "addmm",
     "source_nodes": "output_parallel_6, input_1, output_parallel_7"
    },
    {
     "position": 41,
     "kernel": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "item": 33,
     "kind": "triton",
     "op": "triton_poi_fused__to_copy_add_mul_split_squeeze_view_14",
     "source_nodes": "float_1, modulation, chunk, output_parallel_5, hidden_states_2, output_parallel_7, gate_ffn, mul_11, add_17, hidden_states_3"
    }
   ]
  }
 },
 "seconds": 15.260573148727417,
 "scope": "Sub-operation labels come from retained inductor wrapper source-node comments aligned to the recorded in-graph kernel order of one representative replay per (process, graphId). Alignment is greedy; unmatched kernels stay unlabeled. Labels identify the fused source ops, not tensor values."
}
