wuklab-NUC16 Intel NPU 5 (intel_vpu) OpenVINO 2026.0 int8
Where does Intel NPU compile time go?
Compiling a model for the Intel NPU under OpenVINO can take minutes. This shows exactly
where that time goes — by reading the NPU compiler's own per-pass timing report and presenting
its real nested MLIR TimingScope tree as an interactive, expandable hierarchy. No stage labels are
imposed: every node below is a pipeline group or pass the compiler itself printed, with its own timing.
Measured on a fanless Intel Core Ultra 7 356H mini-PC (NPU 5) on the real int8 OpenVINO IR, by parsing
the compiler's IE_NPU_LOG_FILTER=vpux-compiler report — so it profiles the exact compiler you
run, no source build required.
Key findings
NPU compilation is expensive and scales with model size. A cold compile runs 15–28 s for Qwen2.5-1.5B, 82–242 s for Qwen2.5-7B (int8). One NPUW_LLM compile is actually 7 sub-model compiles.Almost all of it is one-time codegen the blob cache removes. Warm reuse of a cached blob is ~0.7–1.9 s — up to 125× faster than cold.The compiler's own timing tree splits a compile into two groups: IE to VPUIP pipeline (the optimizer/scheduler, ~81% ) and ELF pipeline (the backend/serializer, ~19% ). Expand the tree below to walk the real hierarchy down to individual passes.One pass dominates the large-model compile: FeasibleAllocation — the memory allocator/scheduler — sums to 73 s across Qwen2.5-7B's sub-models (~31% of the whole compile). It sits inside IE to VPUIP pipeline.The bottleneck tracks size, not modality. The same tree for a vision transformer (ViT-large) has the identical shape, and its heaviest pass is also FeasibleAllocation — a ViT and an LLM of similar compile cost stress the same passes.No source build needed. This is the compiler's own report, printed at INFO level via IE_NPU_LOG_FILTER=vpux-compiler — it profiles the exact compiler you run.
1 · Is compilation actually costly?
Cold compile (no cache) versus the warm blob-reuse floor — the whole cost is one-time codegen, so reusing
a cached blob is up to 125× faster.
model window cold s warm-reuse s cache ×
peak MB qwen25_1_5b 128 14.8462 0.7192 20.6 775.5 qwen25_1_5b 256 16.7754 0.7176 23.4 781.7 qwen25_1_5b 512 17.9899 0.7135 25.2 775.5 qwen25_1_5b 1024 23.8757 0.719 33.2 770.6 qwen25_1_5b 2048 28.2005 0.7405 38.1 801.7 qwen25_7b 256 81.977 1.7571 46.7 1107.8 qwen25_7b 1024 226.2104 1.9059 118.7 880.1 qwen25_7b 2048 241.8275 1.9334 125.1 884.3
Cold vs warm-populate vs warm-reuse compile — the blob cache turns a 15–28 s compile into a sub-second load.
Cold compile time vs prompt window (log-log); the 7B scales far steeper than the 1.5B.
Compile time grows ~window^0.24 for the 1.5B but ~window^0.55 for the 7B —
bigger models pay a steeper penalty for a longer static prompt window.
2 · The compiler's own timing tree
Below is the actual MLIR TimingScope tree for a cold Qwen2.5-7B compile — the same report the
compiler prints, rendered as an expandable hierarchy. A single NPUW_LLM compile is several sub-model
compiles (prefill / decode / KV variants); each opens to Total → Compile network →
{IE to VPUIP pipeline, ELF pipeline} and then down to individual passes. Click any
row to expand it; the bar shows its share of that sub-model's compile.
Heaviest passes (summed across all sub-models)
The per-pass time cost, at a glance — the same passes you can drill to in the tree below.
FeasibleAllocation 72.54s
DispatchedInliner 20.13s
ConvertVPUMI40XX2VPUASM 13.21s
MultiClusterStrategyAssignment 9.89s
StaticAllocation 9.47s
Canonicalizer 9.43s
BarrierOptimization 5.67s
ReorderMPIOps 5.63s
SimplifySchedule 5.49s
AddPlaceholderFetchDMAs 3.99s
ConvertVPUIP2VPUMI40XX 3.79s
WlmLegalizeSplitGraphToPages 3.62s
WlmInsertDummyDmasInPages 3.57s
FindWlmEnqueueDmasBarrier 3.35s
Qwen2.5-7B · int8 · window 2048 7 sub-model compiles · 234 s total · the compiler's MLIR TimingScope tree expand all
sub-model 4 71.7s 31% Compile network 71660.3ms 100.0% IE to VPUIP pipeline 58234.5ms 81.2% func.func' Pipeline 24456.8ms 34.1% FeasibleAllocation 23954.4ms 33.4% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 62.5ms 0.1%
(A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 43.2ms 0.1%
(A) vpux::AsyncDepsInfo 25.0ms 0.0%
MoveViewOpsIntoAsyncRegions 269.8ms 0.4%
MoveWaitResultToAsyncBlockArgs 110.8ms 0.2% (A) vpux::AsyncDepsInfo 36.4ms 0.1%
CalculateAsyncRegionCycleCost 66.3ms 0.1%
WrapIntoAsyncRegions 47.3ms 0.1%
MoveDeclarationsToTop 8.1ms 0.0%
func.func' Pipeline 11574.7ms 16.1% BarrierOptimization 1750.7ms 2.4% (A) vpux::BarrierInfo 74.5ms 0.1%
SimplifySchedule 1664.8ms 2.3% (A) vpux::BarrierInfo 68.3ms 0.1%
AddPlaceholderFetchDMAs 1198.5ms 1.7% (A) vpux::ExecutionGroupAnalysis 124.6ms 0.2%
(A) vpux::BarrierInfo 67.9ms 0.1%
WlmInsertDummyDmasInPages 1119.2ms 1.6% (A) vpux::BarrierInfo 70.2ms 0.1%
WlmLegalizeSplitGraphToPages 1106.2ms 1.5% (A) vpux::BarrierInfo 70.3ms 0.1%
FindWlmEnqueueDmasBarrier 1032.1ms 1.4% (A) vpux::ExecutionGroupAnalysis 126.5ms 0.2%
(A) vpux::BarrierInfo 69.4ms 0.1%
WlmLegalizePagesForBarrierDmas 658.3ms 0.9% (A) vpux::BarrierInfo 69.9ms 0.1%
SplitControlGraph 516.4ms 0.7% (A) vpux::BarrierInfo 69.7ms 0.1%
SatisfyOneWaitBarrierPerTask 489.2ms 0.7% (A) vpux::BarrierInfo 69.3ms 0.1%
WlmSplitGraphToPages 425.8ms 0.6% (A) vpux::BarrierInfo 70.3ms 0.1%
AssignPhysicalBarriers 366.5ms 0.5%
OptimizeBarriersSlotsUsage 323.0ms 0.5% (A) vpux::BarrierInfo 70.8ms 0.1%
AddSwKernelInstructionPrefetch 253.8ms 0.4%
AddFinalBarrier 178.2ms 0.2%
AddStartBarrier 151.6ms 0.2% (A) vpux::BarrierInfo 70.0ms 0.1%
WlmInsertDummyBarriersInPages 131.7ms 0.2% (A) vpux::BarrierInfo 70.4ms 0.1%
UpdateSwKernelParams 114.4ms 0.2%
DMAOutOfOrderOptimization 48.5ms 0.1%
InsertDelayDPUVariant 45.7ms 0.1%
DispatchedInliner 6415.5ms 8.9%
func.func' Pipeline 4087.8ms 5.7% StaticAllocation 2972.0ms 4.1% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 179.1ms 0.2% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 84.5ms 0.1%
(A) vpux::AsyncDepsInfo 44.3ms 0.1%
(A) vpux::AllocationInfo 0.9ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 0.3ms 0.0%
(A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 0.2ms 0.0%
OptimizeAsyncDeps 748.1ms 1.0% (A) vpux::AsyncDepsInfo 26.0ms 0.0%
UngroupBoundedBuffers 156.9ms 0.2%
ConvertAsyncOpsToTasks 132.8ms 0.2%
LinearizeCallOps 27.3ms 0.0% (A) vpux::AsyncDepsInfo 20.5ms 0.0%
ConvertAllocationsToDeclarations 22.5ms 0.0%
BreakDataFlow 16.4ms 0.0%
PatchWeightsTable 6.7ms 0.0%
AddSwKernelCacheHandlingOps 5.1ms 0.0%
func.func' Pipeline 3835.6ms 5.3% MultiClusterStrategyAssignment 2874.5ms 4.0%
MergeVfSubgraphs 612.0ms 0.9%
TilingStrategyAssignment 317.2ms 0.4% (A) vpux::VPU::EagerSiblingOpsAnalysis 0.4ms 0.0%
ConvolutionSplitOverInputChannel 28.8ms 0.0%
MoveViewOpsToVF 1.7ms 0.0%
WrapVerticalFusionRegion 0.8ms 0.0%
EnsureNCEOpsSizeRequirements 0.2ms 0.0%
OptimizeConcat 0.2ms 0.0%
SplitGRUSequence 0.1ms 0.0%
EfficientIROrder 0.1ms 0.0%
UnrollUnusedVerticalFusionRegion 0.1ms 0.0%
func.func' Pipeline 1428.5ms 2.0% OptimizeCopies 510.1ms 0.7%
OptimizeParallelCopies 408.4ms 0.6%
OptimizeConcatViewCopies 168.4ms 0.2%
OptimizeConvertDMAOp 105.7ms 0.1%
OptimizeTileOpAsNNDMA 104.7ms 0.1%
FuseDDRCopiesIntoConcats 63.6ms 0.1%
InsertCopyForEltwiseInPlaceInput 17.7ms 0.0% (A) vpux::AliasesInfo 12.6ms 0.0%
FuseLastCopy 17.0ms 0.0% (A) vpux::AliasesInfo 12.8ms 0.0%
UniquifyWeightsTableCopies 13.2ms 0.0%
ConvertToDMA 11.4ms 0.0%
OptimizeSubviewCopies 4.8ms 0.0%
ConvertDynamicReshapeToInPlace 3.3ms 0.0%
func.func' Pipeline 1333.7ms 1.9% UnrollDistributedOps 428.3ms 0.6%
SegmentHalos 191.1ms 0.3%
DetectDMASplitCandidate 175.9ms 0.2%
SplitDMAToBalanceLoad 140.3ms 0.2%
FlattenSparseWeightsTypes 104.0ms 0.1%
NNDMATiling 81.7ms 0.1%
ComputeHaloRegionForDPUTaskOp 76.0ms 0.1%
UnrollSwKernel 41.8ms 0.1%
ComputeSESizes 20.4ms 0.0%
AdjustInputDataForExplicitSETable 18.3ms 0.0%
UnrollDMAAnalysis 18.1ms 0.0% (A) vpux::VPUIP::UnrollDMAAnalysis 18.1ms 0.0%
UnrollShaveCacheOps 17.5ms 0.0%
BatchMatMulToMatMul 13.8ms 0.0%
UnrollPerAxisTileDMA 11.8ms 0.0%
MoveDeclarationsToTop 6.1ms 0.0%
UnrollGatherDMA 2.2ms 0.0%
func.func' Pipeline 604.4ms 0.8% SplitNCEOpsOntoWorkloads 564.1ms 0.8%
ComputeNCEInputWorkloads 25.7ms 0.0%
CorrectNCEWorkloads 7.1ms 0.0%
MoveTensorOpsToCMX 2.8ms 0.0%
ShiftOutputWorkloadsForHalo 2.7ms 0.0%
MoveReflectPadToCMX 2.0ms 0.0%
func.func' Pipeline 504.6ms 0.7% RelocateWeightTableForReuse 255.5ms 0.4%
MakeOpsWithDistributedTensor 172.8ms 0.2%
MakeDistributedCopies 29.5ms 0.0%
OptimizeConcat 16.9ms 0.0%
OptimizeSharedInputCopyForConcat 15.5ms 0.0%
AdjustDistributedTensorAroundOps 7.3ms 0.0%
AdjustMemorySpace 3.6ms 0.0%
ComputeInterpolateCoordinates 2.8ms 0.0%
RemoveOutputSparseToAvoidSuboptimalDPUWorkloadsPass 0.7ms 0.0%
Canonicalizer 487.1ms 0.7%
func.func' Pipeline 385.2ms 0.5% TileActShaveKernelTask 208.1ms 0.3%
MovePureViewOpBeforeCopy 87.0ms 0.1%
ConvertSprLUTToConst 33.7ms 0.0%
WrapWithPermuteAsNNDMA 20.6ms 0.0%
SetZeroOffsetWeightsTable 16.3ms 0.0%
OptimizeExpandSubview 10.2ms 0.0%
ConvertExpand 8.9ms 0.0%
Canonicalizer 349.6ms 0.5%
func.func' Pipeline 335.7ms 0.5% InferenceExecutionAnalysis 335.6ms 0.5%
func.func' Pipeline 290.0ms 0.4% UngroupBufferSectionRewriterExecutor 173.9ms 0.2%
UngroupBoundedBuffers 100.7ms 0.1%
ComputeSEBasePtrs 5.4ms 0.0%
ConvertSETablesToConstants 5.0ms 0.0%
PropagateSparsityCompression 4.9ms 0.0%
func.func' Pipeline 246.8ms 0.3% OutputPipelineTiling 158.8ms 0.2%
ApplyTiling 88.0ms 0.1%
OneShotBufferizeVPU2VPUIP 242.5ms 0.3%
Canonicalizer 225.6ms 0.3%
Canonicalizer 171.0ms 0.2%
SetMemorySpace 142.3ms 0.2% (A) vpux::AliasesInfo 41.0ms 0.1%
Canonicalizer 121.5ms 0.2%
Canonicalizer 121.3ms 0.2%
Canonicalizer 89.3ms 0.1%
Canonicalizer 86.1ms 0.1%
func.func' Pipeline 75.3ms 0.1% ConvertViewOpsToDeclarations 75.3ms 0.1% (A) vpux::AliasesInfo 11.2ms 0.0%
func.func' Pipeline 72.7ms 0.1% ConvertEltwiseToInPlace 72.6ms 0.1% (A) vpux::AliasesInfo 62.1ms 0.1%
func.func' Pipeline 69.5ms 0.1% func.func' Pipeline 67.8ms 0.1% LegalizeRepeatingFuncCalls 31.3ms 0.0%
FuseConstants 18.4ms 0.0%
ConvWeightsCompression 9.8ms 0.0%
ComputeSESizes 8.3ms 0.0%
Canonicalizer 45.7ms 0.1%
Canonicalizer 40.2ms 0.1%
func.func' Pipeline 34.8ms 0.0% ConvertTransferOpsToDMAs 34.8ms 0.0%
ConvertFuncArgsToDeclarations 30.1ms 0.0%
AddCopyBetweenSWKernelsAndNetworkIO 27.4ms 0.0%
Canonicalizer 24.1ms 0.0%
UngroupHostBuffersAsFuncArgs 20.3ms 0.0%
AddBuffersForNetResults 19.3ms 0.0%
AdjustDynamicOpsBeforeBufferization 13.5ms 0.0%
func.func' Pipeline 11.0ms 0.0% func.func' Pipeline 10.7ms 0.0% CorrectStorageElementTableSeSizeForSEPDWConv 10.3ms 0.0%
UnrollFlashSDPA 0.4ms 0.0%
UngroupBoundedBuffersAsFuncArgs 10.7ms 0.0%
func.func' Pipeline 8.2ms 0.0% LegalizeDynamicShapeConcatForSWLayers 4.1ms 0.0%
AdjustMemorySpaceForSHVOps 4.0ms 0.0%
func.func' Pipeline 6.1ms 0.0% ConvertIEToVPUNCE 4.9ms 0.0%
ConvertLayers2VPU 0.9ms 0.0%
ConvertDynamicQuantToVPUNCE 0.2ms 0.0%
BoundedTensorsToDynamicDimsMask 5.8ms 0.0%
func.func' Pipeline 5.4ms 0.0% InputQuantizationRestoration 5.2ms 0.0%
PropagateAndCleanUpFQ 0.1ms 0.0%
ConvertVariadicSplitToStridedSlice 0.1ms 0.0%
QueryArgsAllocationAnalysis 4.1ms 0.0% (A) vpux::ReservedMemInfo 4.1ms 0.0% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 3.3ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 3.1ms 0.0%
(A) vpux::AllocationInfo 0.4ms 0.0%
ConvertPrecisionToFP16 2.6ms 0.0%
func.func' Pipeline 2.6ms 0.0% MemPermuteProcessingPipelineRewriterExecutor 2.2ms 0.0%
ConvertMemPermuteToOpPass 0.4ms 0.0%
func.func' Pipeline 2.1ms 0.0% ConvertWeightsToU8 0.6ms 0.0%
ConvertWeightsToU8 0.5ms 0.0%
PropagateAndFuseQuantizeDequantize 0.2ms 0.0%
FuseActivationOps 0.2ms 0.0%
ConvertToMixedPrecision 0.2ms 0.0%
ConvertToMixedPrecision 0.2ms 0.0%
ConvertWeightsToI4 0.1ms 0.0%
func.func' Pipeline 2.1ms 0.0% SwapOperations 0.9ms 0.0%
PropagateAffineReshape 0.6ms 0.0%
UniquifyBranches 0.3ms 0.0%
UniquifySimilarOps 0.1ms 0.0%
PropagateExpand 0.1ms 0.0%
func.func' Pipeline 2.0ms 0.0% ConvertExtractImagePatches 0.8ms 0.0%
ConvertFCToConv 0.5ms 0.0%
MergeParallelFullyConnected 0.1ms 0.0%
UnrollGroupQuantize 0.1ms 0.0%
SwapOperationWithGather 0.1ms 0.0%
MergeFullyConnected 0.1ms 0.0%
ConvertReduceToPooling 0.1ms 0.0%
ConvertGather 0.1ms 0.0%
func.func' Pipeline 2.0ms 0.0% AdjustForVPUPipelineRewriterExecutor 0.8ms 0.0%
SwapOperations 0.6ms 0.0%
ConvertScatter 0.2ms 0.0%
ConvertBroadcastToTile 0.1ms 0.0%
ConvertPadToConcat 0.1ms 0.0%
Canonicalizer 1.7ms 0.0%
func.func' Pipeline 1.6ms 0.0% ConvertShapeTo4D 0.7ms 0.0%
AdaptShapesForScaleShiftPass 0.4ms 0.0%
HandleLargeKernels 0.3ms 0.0%
AdaptShapesForScaleShiftPass 0.2ms 0.0%
func.func' Pipeline 1.5ms 0.0% PropagateAffineReshape 0.8ms 0.0%
PropagateTranspose 0.4ms 0.0%
UniquifyBranches 0.3ms 0.0%
func.func' Pipeline 1.5ms 0.0% AdjustLayouts 1.2ms 0.0%
TransposeToPermuteCast 0.3ms 0.0%
func.func' Pipeline 1.4ms 0.0% BatchOpProcessingPipelineRewriterExecutor 1.3ms 0.0%
func.func' Pipeline 1.3ms 0.0% func.func' Pipeline 1.2ms 0.0% OptimizeReorders 1.2ms 0.0%
func.func' Pipeline 1.0ms 0.0% SwapOperations 0.6ms 0.0%
ConvertToScaleShift 0.3ms 0.0%
func.func' Pipeline 1.0ms 0.0% OptimizeActivationsPipelineRewriterExecutor 0.7ms 0.0%
ConvertShapeTo4D 0.2ms 0.0%
SwapViewOpAndClamp 0.1ms 0.0%
SwapConvertWithSWOp 0.1ms 0.0%
func.func' Pipeline 1.0ms 0.0% EnsureNCEOpsSizeRequirements 0.3ms 0.0%
OptimizeConcat 0.3ms 0.0%
ConvertOpToDMAForPerformantExecution 0.1ms 0.0%
DetectionOutputDecomposition 0.1ms 0.0%
SplitRealDFTOps 0.1ms 0.0%
VerticalFusionOutlining 1.0ms 0.0%
Canonicalizer 0.9ms 0.0%
func.func' Pipeline 0.9ms 0.0% ConvertBatchedLayerTo1N 0.6ms 0.0%
UpstreamSlice 0.2ms 0.0%
ConvertBroadcastToTile 0.1ms 0.0%
func.func' Pipeline 0.9ms 0.0% AdjustMemPermuteAroundOp 0.3ms 0.0%
ExpandActivationChannels 0.3ms 0.0%
UniquifySimilarOps 0.1ms 0.0%
AdjustConvolutionShape 0.1ms 0.0%
func.func' Pipeline 0.9ms 0.0% AdjustConvolutionInputShape 0.3ms 0.0%
OptimizeSliceExpand 0.2ms 0.0%
AdjustInputShape 0.2ms 0.0%
AdjustConvolutionWeights 0.1ms 0.0%
func.func' Pipeline 0.8ms 0.0% SwapOperations 0.6ms 0.0%
ConvertSplitConcatToAffineReshape 0.1ms 0.0%
Canonicalizer 0.8ms 0.0%
func.func' Pipeline 0.7ms 0.0% HandleLargeKernels 0.3ms 0.0%
HandleLargeStrides 0.1ms 0.0%
ConvertStridedSlice2Conv 0.1ms 0.0%
SplitConvWithMultipleFQ 0.1ms 0.0%
func.func' Pipeline 0.7ms 0.0% PropagateMemPermuteBeforeOp 0.6ms 0.0%
LegalizeNDMemPermute 0.1ms 0.0%
LegalizeStridedDmas 0.7ms 0.0%
Canonicalizer 0.6ms 0.0%
Canonicalizer 0.6ms 0.0%
func.func' Pipeline 0.6ms 0.0% UniquifyBranches 0.4ms 0.0%
PropagateReorderToNCE 0.1ms 0.0%
Canonicalizer 0.6ms 0.0%
func.func' Pipeline 0.6ms 0.0% AdaptODUPermutePass 0.3ms 0.0%
PropagateShapeCast 0.1ms 0.0%
PropagatePermuteCast 0.1ms 0.0%
func.func' Pipeline 0.5ms 0.0% SwapConvertWithReshapeKindOps 0.2ms 0.0%
AlignScales 0.2ms 0.0%
SwapFakeQuantWithReshapeAndStridedSlice 0.1ms 0.0%
Canonicalizer 0.5ms 0.0%
func.func' Pipeline 0.5ms 0.0% UniquifySimilarOps 0.1ms 0.0%
AdjustConvolutionShape 0.1ms 0.0%
AlignDimensionsForDPU 0.1ms 0.0%
AdjustInputShape 0.1ms 0.0%
func.func' Pipeline 0.5ms 0.0% PropagateAffineReshape 0.4ms 0.0%
OptimizeSliceExpand 0.1ms 0.0%
Canonicalizer 0.4ms 0.0%
ConvertPrecisionToI32 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
func.func' Pipeline 0.4ms 0.0% ConvertToMemPermute 0.2ms 0.0%
ConvertReorderToPermuteQuantize 0.1ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% LegalizeReifyResultShapesResiduals 0.1ms 0.0%
ConvertScalarToTensor 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% OptimizeParallelLayers 0.2ms 0.0%
Canonicalizer 0.3ms 0.0%
CSE 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% MovePermutePostEltwise 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% OptimizeSliceExpand 0.3ms 0.0%
DumpStatisticsOfIeOps 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
StopLocationVerifierPass 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
CSE 0.2ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
CSE 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% UniquifySimilarOps 0.1ms 0.0%
RemoveViewLikeOpsChainPass 0.1ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
DumpStatisticsOfIeOps 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% DetectInPlaceEltwise 0.1ms 0.0%
StopLocationVerifierPass 0.1ms 0.0%
ResolveShapedTypeResultDimsPass 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% InitialLowPrecisionTransformationsPipelineRewriterExecutor 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% func.func' Pipeline 0.1ms 0.0% ConvertScaleShiftToDW 0.1ms 0.0%
OptimizePrecisionAcrossFunctionCalls 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% PropagateMemPermuteThroughEltwise 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% ConvertSplitConcatToTranspose 0.1ms 0.0%
ConcatRepeatingBlocksOutlining 0.1ms 0.0%
ELF pipeline 13425.8ms 18.7% ConvertVPUMI40XX2VPUASM 3936.1ms 5.5%
func.func' Pipeline 2263.7ms 3.2% ReorderMPIOps 988.9ms 1.4%
AddBootstrapWorkItems 621.5ms 0.9%
AddBarrierConfigurationOps 195.8ms 0.3%
LinkEnqueueTargets 179.3ms 0.3%
UnrollFetchTaskOps 134.5ms 0.2%
UpdateEnqueueDMAInputAndOutput 57.5ms 0.1%
NextSameIdAssignment 47.0ms 0.1%
LinkEnqueueOpsForSameBarrier 39.0ms 0.1%
func.func' Pipeline 1109.4ms 1.5% ConvertVPUIP2VPUMI40XX 1109.4ms 1.5%
func.func' Pipeline 1107.0ms 1.5% ReorderMPIOps 777.8ms 1.1%
ResolveWLMTaskLocation 99.2ms 0.1%
GroupExecutionOps 64.1ms 0.1%
ConvertFetchDmasToFetchTaskOps 64.1ms 0.1%
PropagateFinalBarrier 62.5ms 0.1%
UnGroupExecutionOps 39.4ms 0.1%
func.func' Pipeline 952.4ms 1.3% ExpandDPUConfig 952.4ms 1.3%
Canonicalizer 858.7ms 1.2%
ConvertVPUASM2NPUReg50XX 749.4ms 1.0%
ConvertVPUIPDPU2NPUReg50XX 733.2ms 1.0%
func.func' Pipeline 624.1ms 0.9% SetOpOffsets 392.8ms 0.5%
HandleAlignmentRequirements 231.3ms 0.3%
func.func' Pipeline 426.8ms 0.6% AddELFRelocations 388.1ms 0.5%
AddRelocationsForDynamicStridesDmas 38.8ms 0.1%
Canonicalizer 315.4ms 0.4%
UpdateELFSectionFlags 203.1ms 0.3%
DeduceDynamicMappedInferenceVersion 62.4ms 0.1%
func.func' Pipeline 41.3ms 0.1% AddMappedInferenceVersionOp 41.2ms 0.1%
SetupProfilingVPUMI40XX 27.7ms 0.0%
func.func' Pipeline 11.4ms 0.0% SetEntryPoint 6.7ms 0.0%
AddELFSymbolTable 4.7ms 0.0%
HoistInputOutputs 0.2ms 0.0%
Build compilation pipeline 0.1ms 0.0%
SetCMXSymbolValue 0.1ms 0.0%
Import network 30.9ms 0.0% Common nGraph passes 28.3ms 0.0%
Import nGraph function 0.8ms 0.0%
Validate MLIR module 0.6ms 0.0%
Add NetworkInfo Operation 0.2ms 0.0%
Rest 3.1ms 0.0%
sub-model 5 70.3s 30% Compile network 70232.6ms 100.0% IE to VPUIP pipeline 57647.5ms 82.1% func.func' Pipeline 24621.7ms 35.0% FeasibleAllocation 24114.7ms 34.3% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 57.6ms 0.1%
(A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 43.0ms 0.1%
(A) vpux::AsyncDepsInfo 25.2ms 0.0%
MoveViewOpsIntoAsyncRegions 271.7ms 0.4%
MoveWaitResultToAsyncBlockArgs 111.4ms 0.2% (A) vpux::AsyncDepsInfo 36.1ms 0.1%
CalculateAsyncRegionCycleCost 65.9ms 0.1%
WrapIntoAsyncRegions 48.2ms 0.1%
MoveDeclarationsToTop 9.8ms 0.0%
func.func' Pipeline 11465.2ms 16.3% BarrierOptimization 1622.3ms 2.3% (A) vpux::BarrierInfo 69.3ms 0.1%
SimplifySchedule 1573.6ms 2.2% (A) vpux::BarrierInfo 64.1ms 0.1%
AddPlaceholderFetchDMAs 1138.2ms 1.6% (A) vpux::ExecutionGroupAnalysis 122.1ms 0.2%
(A) vpux::BarrierInfo 64.4ms 0.1%
WlmInsertDummyDmasInPages 1054.5ms 1.5% (A) vpux::BarrierInfo 66.4ms 0.1%
WlmLegalizeSplitGraphToPages 1039.3ms 1.5% (A) vpux::BarrierInfo 66.2ms 0.1%
FindWlmEnqueueDmasBarrier 964.3ms 1.4% (A) vpux::ExecutionGroupAnalysis 117.4ms 0.2%
(A) vpux::BarrierInfo 65.1ms 0.1%
AddSwKernelInstructionPrefetch 818.7ms 1.2% (A) vpux::BarrierInfo 63.3ms 0.1%
WlmLegalizePagesForBarrierDmas 621.4ms 0.9% (A) vpux::BarrierInfo 66.1ms 0.1%
SplitControlGraph 489.6ms 0.7% (A) vpux::BarrierInfo 66.4ms 0.1%
SatisfyOneWaitBarrierPerTask 459.1ms 0.7% (A) vpux::BarrierInfo 65.1ms 0.1%
WlmSplitGraphToPages 402.1ms 0.6% (A) vpux::BarrierInfo 65.6ms 0.1%
AssignPhysicalBarriers 341.6ms 0.5%
OptimizeBarriersSlotsUsage 307.7ms 0.4% (A) vpux::BarrierInfo 69.6ms 0.1%
AddFinalBarrier 166.9ms 0.2%
AddStartBarrier 141.2ms 0.2% (A) vpux::BarrierInfo 65.7ms 0.1%
WlmInsertDummyBarriersInPages 125.0ms 0.2% (A) vpux::BarrierInfo 66.2ms 0.1%
UpdateSwKernelParams 109.7ms 0.2%
InsertDelayDPUVariant 44.9ms 0.1%
DMAOutOfOrderOptimization 44.9ms 0.1%
DispatchedInliner 6087.4ms 8.7%
func.func' Pipeline 4030.5ms 5.7% StaticAllocation 2979.4ms 4.2% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 161.2ms 0.2% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 69.3ms 0.1%
(A) vpux::AsyncDepsInfo 39.4ms 0.1%
(A) vpux::AllocationInfo 0.4ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 0.1ms 0.0%
(A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 0.1ms 0.0%
OptimizeAsyncDeps 708.5ms 1.0% (A) vpux::AsyncDepsInfo 25.5ms 0.0%
ConvertAsyncOpsToTasks 138.5ms 0.2%
UngroupBoundedBuffers 127.8ms 0.2%
LinearizeCallOps 26.1ms 0.0% (A) vpux::AsyncDepsInfo 20.3ms 0.0%
ConvertAllocationsToDeclarations 22.3ms 0.0%
BreakDataFlow 16.0ms 0.0%
PatchWeightsTable 6.8ms 0.0%
AddSwKernelCacheHandlingOps 5.0ms 0.0%
func.func' Pipeline 3744.2ms 5.3% MultiClusterStrategyAssignment 2744.2ms 3.9%
MergeVfSubgraphs 609.0ms 0.9%
TilingStrategyAssignment 359.9ms 0.5% (A) vpux::VPU::EagerSiblingOpsAnalysis 0.3ms 0.0%
ConvolutionSplitOverInputChannel 28.1ms 0.0%
MoveViewOpsToVF 1.7ms 0.0%
WrapVerticalFusionRegion 0.7ms 0.0%
OptimizeConcat 0.2ms 0.0%
EnsureNCEOpsSizeRequirements 0.1ms 0.0%
EfficientIROrder 0.1ms 0.0%
UnrollUnusedVerticalFusionRegion 0.1ms 0.0%
func.func' Pipeline 1446.5ms 2.1% OptimizeCopies 524.9ms 0.7%
OptimizeParallelCopies 428.0ms 0.6%
OptimizeConcatViewCopies 148.1ms 0.2%
OptimizeTileOpAsNNDMA 110.1ms 0.2%
OptimizeConvertDMAOp 105.4ms 0.2%
FuseDDRCopiesIntoConcats 60.0ms 0.1%
FuseLastCopy 19.1ms 0.0% (A) vpux::AliasesInfo 14.0ms 0.0%
InsertCopyForEltwiseInPlaceInput 18.2ms 0.0% (A) vpux::AliasesInfo 13.0ms 0.0%
ConvertToDMA 12.1ms 0.0%
UniquifyWeightsTableCopies 11.8ms 0.0%
OptimizeSubviewCopies 5.2ms 0.0%
ConvertDynamicReshapeToInPlace 3.6ms 0.0%
func.func' Pipeline 1331.5ms 1.9% UnrollDistributedOps 415.8ms 0.6%
SegmentHalos 189.5ms 0.3%
DetectDMASplitCandidate 173.6ms 0.2%
SplitDMAToBalanceLoad 139.5ms 0.2%
FlattenSparseWeightsTypes 107.8ms 0.2%
ComputeHaloRegionForDPUTaskOp 78.8ms 0.1%
NNDMATiling 76.4ms 0.1%
UnrollSwKernel 50.0ms 0.1%
ComputeSESizes 21.0ms 0.0%
UnrollDMAAnalysis 18.8ms 0.0% (A) vpux::VPUIP::UnrollDMAAnalysis 18.8ms 0.0%
AdjustInputDataForExplicitSETable 18.4ms 0.0%
UnrollShaveCacheOps 18.4ms 0.0%
BatchMatMulToMatMul 13.6ms 0.0%
MoveDeclarationsToTop 9.7ms 0.0%
UnrollPerAxisTileDMA 0.8ms 0.0%
func.func' Pipeline 590.4ms 0.8% SplitNCEOpsOntoWorkloads 549.2ms 0.8%
ComputeNCEInputWorkloads 26.0ms 0.0%
CorrectNCEWorkloads 7.6ms 0.0%
MoveTensorOpsToCMX 3.1ms 0.0%
ShiftOutputWorkloadsForHalo 2.5ms 0.0%
MoveReflectPadToCMX 1.9ms 0.0%
func.func' Pipeline 499.4ms 0.7% RelocateWeightTableForReuse 250.6ms 0.4%
MakeOpsWithDistributedTensor 167.4ms 0.2%
MakeDistributedCopies 33.1ms 0.0%
OptimizeSharedInputCopyForConcat 17.5ms 0.0%
OptimizeConcat 17.5ms 0.0%
AdjustDistributedTensorAroundOps 6.8ms 0.0%
AdjustMemorySpace 3.5ms 0.0%
ComputeInterpolateCoordinates 2.4ms 0.0%
RemoveOutputSparseToAvoidSuboptimalDPUWorkloadsPass 0.7ms 0.0%
Canonicalizer 459.2ms 0.7%
func.func' Pipeline 379.2ms 0.5% TileActShaveKernelTask 205.9ms 0.3%
MovePureViewOpBeforeCopy 84.4ms 0.1%
ConvertSprLUTToConst 31.2ms 0.0%
WrapWithPermuteAsNNDMA 20.1ms 0.0%
SetZeroOffsetWeightsTable 18.8ms 0.0%
OptimizeExpandSubview 9.9ms 0.0%
ConvertExpand 8.7ms 0.0%
Canonicalizer 321.2ms 0.5%
func.func' Pipeline 320.5ms 0.5% InferenceExecutionAnalysis 320.5ms 0.5%
func.func' Pipeline 276.1ms 0.4% UngroupBufferSectionRewriterExecutor 163.6ms 0.2%
UngroupBoundedBuffers 97.2ms 0.1%
ComputeSEBasePtrs 5.3ms 0.0%
ConvertSETablesToConstants 5.0ms 0.0%
PropagateSparsityCompression 4.8ms 0.0%
func.func' Pipeline 254.6ms 0.4% OutputPipelineTiling 165.7ms 0.2%
ApplyTiling 88.9ms 0.1%
ManualStrategyUtils 0.1ms 0.0%
OneShotBufferizeVPU2VPUIP 230.5ms 0.3%
Canonicalizer 203.0ms 0.3%
Canonicalizer 159.1ms 0.2%
SetMemorySpace 132.4ms 0.2% (A) vpux::AliasesInfo 37.4ms 0.1%
Canonicalizer 112.5ms 0.2%
Canonicalizer 112.3ms 0.2%
func.func' Pipeline 94.4ms 0.1% Canonicalizer 81.3ms 0.1%
Canonicalizer 73.9ms 0.1%
func.func' Pipeline 73.1ms 0.1% ConvertViewOpsToDeclarations 73.1ms 0.1% (A) vpux::AliasesInfo 10.3ms 0.0%
Canonicalizer 66.8ms 0.1%
func.func' Pipeline 58.0ms 0.1% ConvertEltwiseToInPlace 58.0ms 0.1% (A) vpux::AliasesInfo 48.3ms 0.1%
func.func' Pipeline 57.4ms 0.1% ConvertTransferOpsToDMAs 57.4ms 0.1%
Canonicalizer 45.2ms 0.1%
func.func' Pipeline 39.5ms 0.1% LegalizeRepeatingFuncCalls 19.5ms 0.0%
FuseConstants 10.6ms 0.0%
ConvWeightsCompression 5.2ms 0.0%
ComputeSESizes 4.1ms 0.0%
ConvertFuncArgsToDeclarations 28.6ms 0.0%
AddCopyBetweenSWKernelsAndNetworkIO 25.8ms 0.0%
Canonicalizer 21.4ms 0.0%
UngroupHostBuffersAsFuncArgs 16.9ms 0.0%
AddBuffersForNetResults 16.3ms 0.0%
AdjustDynamicOpsBeforeBufferization 12.7ms 0.0%
func.func' Pipeline 11.2ms 0.0% func.func' Pipeline 10.6ms 0.0% CorrectStorageElementTableSeSizeForSEPDWConv 10.2ms 0.0%
UnrollFlashSDPA 0.4ms 0.0%
func.func' Pipeline 8.9ms 0.0% LegalizeDynamicShapeConcatForSWLayers 4.5ms 0.0%
AdjustMemorySpaceForSHVOps 4.4ms 0.0%
UngroupBoundedBuffersAsFuncArgs 8.5ms 0.0%
func.func' Pipeline 6.0ms 0.0% ConvertIEToVPUNCE 4.9ms 0.0%
ConvertLayers2VPU 0.8ms 0.0%
ConvertDynamicQuantToVPUNCE 0.2ms 0.0%
BoundedTensorsToDynamicDimsMask 5.5ms 0.0%
func.func' Pipeline 3.1ms 0.0% InputQuantizationRestoration 2.9ms 0.0%
PropagateAndCleanUpFQ 0.1ms 0.0%
ConvertVariadicSplitToStridedSlice 0.1ms 0.0%
Canonicalizer 2.7ms 0.0%
QueryArgsAllocationAnalysis 2.4ms 0.0% (A) vpux::ReservedMemInfo 2.4ms 0.0% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 1.8ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 1.7ms 0.0%
(A) vpux::AllocationInfo 0.3ms 0.0%
func.func' Pipeline 2.3ms 0.0% MemPermuteProcessingPipelineRewriterExecutor 2.0ms 0.0%
ConvertMemPermuteToOpPass 0.3ms 0.0%
ConvertPrecisionToFP16 2.2ms 0.0%
func.func' Pipeline 1.9ms 0.0% ConvertExtractImagePatches 0.8ms 0.0%
ConvertFCToConv 0.5ms 0.0%
MergeParallelFullyConnected 0.1ms 0.0%
UnrollGroupQuantize 0.1ms 0.0%
SwapOperationWithGather 0.1ms 0.0%
MergeFullyConnected 0.1ms 0.0%
ConvertReduceToPooling 0.1ms 0.0%
ConvertGather 0.1ms 0.0%
func.func' Pipeline 1.9ms 0.0% SwapOperations 0.8ms 0.0%
PropagateAffineReshape 0.6ms 0.0%
UniquifyBranches 0.3ms 0.0%
UniquifySimilarOps 0.1ms 0.0%
PropagateExpand 0.1ms 0.0%
func.func' Pipeline 1.8ms 0.0% AdjustForVPUPipelineRewriterExecutor 0.7ms 0.0%
SwapOperations 0.6ms 0.0%
ConvertScatter 0.2ms 0.0%
LegalizeDilatedConvolution 0.1ms 0.0%
ConvertBroadcastToTile 0.1ms 0.0%
ConvertPadToConcat 0.1ms 0.0%
func.func' Pipeline 1.8ms 0.0% ConvertWeightsToU8 0.5ms 0.0%
ConvertWeightsToU8 0.5ms 0.0%
FuseActivationOps 0.2ms 0.0%
ConvertToMixedPrecision 0.2ms 0.0%
PropagateAndFuseQuantizeDequantize 0.1ms 0.0%
ConvertWeightsToI4 0.1ms 0.0%
ConvertToMixedPrecision 0.1ms 0.0%
func.func' Pipeline 1.8ms 0.0% func.func' Pipeline 1.4ms 0.0% ConvertShapeTo4D 0.5ms 0.0%
HandleLargeKernels 0.3ms 0.0%
AdaptShapesForScaleShiftPass 0.3ms 0.0%
AdaptShapesForScaleShiftPass 0.1ms 0.0%
func.func' Pipeline 1.4ms 0.0% PropagateAffineReshape 0.7ms 0.0%
PropagateTranspose 0.4ms 0.0%
UniquifyBranches 0.3ms 0.0%
func.func' Pipeline 1.4ms 0.0% AdjustLayouts 1.1ms 0.0%
TransposeToPermuteCast 0.3ms 0.0%
func.func' Pipeline 1.2ms 0.0% BatchOpProcessingPipelineRewriterExecutor 1.1ms 0.0%
VerticalFusionOutlining 1.2ms 0.0%
func.func' Pipeline 1.1ms 0.0% OptimizeReorders 1.0ms 0.0%
func.func' Pipeline 1.0ms 0.0% OptimizeActivationsPipelineRewriterExecutor 0.6ms 0.0%
ConvertShapeTo4D 0.2ms 0.0%
SwapViewOpAndClamp 0.1ms 0.0%
SwapConvertWithSWOp 0.1ms 0.0%
Canonicalizer 1.0ms 0.0%
func.func' Pipeline 0.9ms 0.0% SwapOperations 0.6ms 0.0%
ConvertToScaleShift 0.2ms 0.0%
ConvertGRNToNormalizeL2 0.1ms 0.0%
func.func' Pipeline 0.8ms 0.0% SwapOperations 0.6ms 0.0%
ConvertSplitConcatToAffineReshape 0.1ms 0.0%
func.func' Pipeline 0.8ms 0.0% ConvertBatchedLayerTo1N 0.5ms 0.0%
UpstreamSlice 0.2ms 0.0%
ConvertBroadcastToTile 0.1ms 0.0%
func.func' Pipeline 0.8ms 0.0% AdjustMemPermuteAroundOp 0.3ms 0.0%
ExpandActivationChannels 0.3ms 0.0%
UniquifySimilarOps 0.1ms 0.0%
AdjustConvolutionShape 0.1ms 0.0%
func.func' Pipeline 0.8ms 0.0% AdjustConvolutionInputShape 0.3ms 0.0%
OptimizeSliceExpand 0.2ms 0.0%
AdjustInputShape 0.2ms 0.0%
AdjustConvolutionWeights 0.1ms 0.0%
func.func' Pipeline 0.8ms 0.0% EnsureNCEOpsSizeRequirements 0.3ms 0.0%
OptimizeConcat 0.2ms 0.0%
Canonicalizer 0.7ms 0.0%
func.func' Pipeline 0.6ms 0.0% HandleLargeKernels 0.3ms 0.0%
HandleLargeStrides 0.1ms 0.0%
ConvertStridedSlice2Conv 0.1ms 0.0%
SplitConvWithMultipleFQ 0.1ms 0.0%
func.func' Pipeline 0.6ms 0.0% PropagateMemPermuteBeforeOp 0.5ms 0.0%
LegalizeNDMemPermute 0.1ms 0.0%
Canonicalizer 0.5ms 0.0%
Canonicalizer 0.5ms 0.0%
func.func' Pipeline 0.5ms 0.0% UniquifyBranches 0.4ms 0.0%
PropagateReorderToNCE 0.1ms 0.0%
Canonicalizer 0.5ms 0.0%
func.func' Pipeline 0.5ms 0.0% UniquifySimilarOps 0.1ms 0.0%
AdjustConvolutionShape 0.1ms 0.0%
AlignDimensionsForDPU 0.1ms 0.0%
AdjustInputShape 0.1ms 0.0%
func.func' Pipeline 0.5ms 0.0% AdaptODUPermutePass 0.2ms 0.0%
PropagateShapeCast 0.1ms 0.0%
PropagatePermuteCast 0.1ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
func.func' Pipeline 0.3ms 0.0% OptimizeParallelLayers 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% SwapFakeQuantWithReshapeAndStridedSlice 0.1ms 0.0%
SwapConvertWithReshapeKindOps 0.1ms 0.0%
AlignScales 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% ConvertToMemPermute 0.2ms 0.0%
ConvertReorderToPermuteQuantize 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% MovePermutePostEltwise 0.2ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% OptimizeSliceExpand 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% PropagateAffineReshape 0.2ms 0.0%
OptimizeSliceExpand 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% ConvertScalarToTensor 0.1ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
ConvertPrecisionToI32 0.2ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
CSE 0.2ms 0.0%
StopLocationVerifierPass 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
CSE 0.2ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
CSE 0.2ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% DetectInPlaceEltwise 0.1ms 0.0%
DumpStatisticsOfIeOps 0.1ms 0.0%
StopLocationVerifierPass 0.1ms 0.0%
ResolveShapedTypeResultDimsPass 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% InitialLowPrecisionTransformationsPipelineRewriterExecutor 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% ConvertScaleShiftToDW 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
OptimizePrecisionAcrossFunctionCalls 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% PropagateMemPermuteThroughEltwise 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% ConvertSplitConcatToTranspose 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% UniquifySimilarOps 0.1ms 0.0%
DumpStatisticsOfIeOps 0.1ms 0.0%
ELF pipeline 12585.1ms 17.9% ConvertVPUMI40XX2VPUASM 3689.2ms 5.3%
func.func' Pipeline 2087.3ms 3.0% ReorderMPIOps 916.0ms 1.3%
AddBootstrapWorkItems 568.0ms 0.8%
AddBarrierConfigurationOps 185.5ms 0.3%
LinkEnqueueTargets 161.2ms 0.2%
UnrollFetchTaskOps 123.6ms 0.2%
UpdateEnqueueDMAInputAndOutput 53.5ms 0.1%
NextSameIdAssignment 43.5ms 0.1%
LinkEnqueueOpsForSameBarrier 35.9ms 0.1%
func.func' Pipeline 1046.2ms 1.5% ConvertVPUIP2VPUMI40XX 1046.1ms 1.5%
func.func' Pipeline 1012.5ms 1.4% ReorderMPIOps 711.2ms 1.0%
ResolveWLMTaskLocation 93.0ms 0.1%
GroupExecutionOps 58.4ms 0.1%
ConvertFetchDmasToFetchTaskOps 57.4ms 0.1%
PropagateFinalBarrier 56.2ms 0.1%
UnGroupExecutionOps 36.2ms 0.1%
func.func' Pipeline 915.9ms 1.3% ExpandDPUConfig 915.9ms 1.3%
Canonicalizer 796.3ms 1.1%
ConvertVPUASM2NPUReg50XX 715.2ms 1.0%
ConvertVPUIPDPU2NPUReg50XX 687.9ms 1.0%
func.func' Pipeline 599.8ms 0.9% SetOpOffsets 386.0ms 0.5%
HandleAlignmentRequirements 213.8ms 0.3%
func.func' Pipeline 407.9ms 0.6% AddELFRelocations 371.5ms 0.5%
AddRelocationsForDynamicStridesDmas 36.4ms 0.1%
Canonicalizer 292.1ms 0.4%
UpdateELFSectionFlags 197.7ms 0.3%
DeduceDynamicMappedInferenceVersion 60.6ms 0.1%
func.func' Pipeline 37.1ms 0.1% AddMappedInferenceVersionOp 37.1ms 0.1%
SetupProfilingVPUMI40XX 25.2ms 0.0%
func.func' Pipeline 9.1ms 0.0% SetEntryPoint 6.2ms 0.0%
AddELFSymbolTable 2.9ms 0.0%
Build compilation pipeline 0.1ms 0.0%
HoistInputOutputs 0.1ms 0.0%
Import network 21.3ms 0.0% Common nGraph passes 19.1ms 0.0%
Import nGraph function 0.6ms 0.0%
Validate MLIR module 0.4ms 0.0%
Add NetworkInfo Operation 0.2ms 0.0%
Rest 1.6ms 0.0%
sub-model 6 66.6s 28% Compile network 66598.5ms 100.0% IE to VPUIP pipeline 54646.4ms 82.0% func.func' Pipeline 23964.6ms 36.0% FeasibleAllocation 23490.0ms 35.3% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 54.4ms 0.1%
(A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 40.0ms 0.1%
(A) vpux::AsyncDepsInfo 22.5ms 0.0%
MoveViewOpsIntoAsyncRegions 247.3ms 0.4%
MoveWaitResultToAsyncBlockArgs 106.1ms 0.2% (A) vpux::AsyncDepsInfo 33.0ms 0.0%
CalculateAsyncRegionCycleCost 62.0ms 0.1%
WrapIntoAsyncRegions 49.1ms 0.1%
MoveDeclarationsToTop 9.9ms 0.0%
func.func' Pipeline 10724.7ms 16.1% BarrierOptimization 1503.6ms 2.3% (A) vpux::BarrierInfo 65.0ms 0.1%
SimplifySchedule 1472.6ms 2.2% (A) vpux::BarrierInfo 60.9ms 0.1%
AddPlaceholderFetchDMAs 1048.3ms 1.6% (A) vpux::ExecutionGroupAnalysis 110.8ms 0.2%
(A) vpux::BarrierInfo 61.1ms 0.1%
WlmInsertDummyDmasInPages 987.5ms 1.5% (A) vpux::BarrierInfo 61.4ms 0.1%
WlmLegalizeSplitGraphToPages 979.4ms 1.5% (A) vpux::BarrierInfo 61.8ms 0.1%
FindWlmEnqueueDmasBarrier 896.2ms 1.3% (A) vpux::ExecutionGroupAnalysis 111.1ms 0.2%
(A) vpux::BarrierInfo 61.4ms 0.1%
AddSwKernelInstructionPrefetch 763.6ms 1.1% (A) vpux::BarrierInfo 59.3ms 0.1%
WlmLegalizePagesForBarrierDmas 602.3ms 0.9% (A) vpux::BarrierInfo 62.1ms 0.1%
SplitControlGraph 456.5ms 0.7% (A) vpux::BarrierInfo 61.2ms 0.1%
SatisfyOneWaitBarrierPerTask 432.6ms 0.6% (A) vpux::BarrierInfo 61.1ms 0.1%
WlmSplitGraphToPages 374.3ms 0.6% (A) vpux::BarrierInfo 60.9ms 0.1%
AssignPhysicalBarriers 324.0ms 0.5%
OptimizeBarriersSlotsUsage 289.0ms 0.4% (A) vpux::BarrierInfo 62.4ms 0.1%
AddFinalBarrier 156.3ms 0.2%
AddStartBarrier 132.6ms 0.2% (A) vpux::BarrierInfo 61.1ms 0.1%
WlmInsertDummyBarriersInPages 118.5ms 0.2% (A) vpux::BarrierInfo 62.6ms 0.1%
UpdateSwKernelParams 103.0ms 0.2%
DMAOutOfOrderOptimization 43.4ms 0.1%
InsertDelayDPUVariant 41.0ms 0.1%
DispatchedInliner 5688.0ms 8.5%
func.func' Pipeline 4007.4ms 6.0% StaticAllocation 2927.6ms 4.4% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 159.5ms 0.2% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 74.5ms 0.1%
(A) vpux::AsyncDepsInfo 37.0ms 0.1%
(A) vpux::AllocationInfo 0.4ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 0.1ms 0.0%
(A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 0.1ms 0.0%
OptimizeAsyncDeps 744.6ms 1.1% (A) vpux::AsyncDepsInfo 22.6ms 0.0%
UngroupBoundedBuffers 139.2ms 0.2%
ConvertAsyncOpsToTasks 123.6ms 0.2%
LinearizeCallOps 25.2ms 0.0% (A) vpux::AsyncDepsInfo 19.8ms 0.0%
ConvertAllocationsToDeclarations 21.3ms 0.0%
BreakDataFlow 15.5ms 0.0%
PatchWeightsTable 5.7ms 0.0%
AddSwKernelCacheHandlingOps 4.8ms 0.0%
func.func' Pipeline 3452.1ms 5.2% MultiClusterStrategyAssignment 2589.3ms 3.9%
MergeVfSubgraphs 622.2ms 0.9%
TilingStrategyAssignment 210.9ms 0.3% (A) vpux::VPU::EagerSiblingOpsAnalysis 0.3ms 0.0%
ConvolutionSplitOverInputChannel 27.1ms 0.0%
MoveViewOpsToVF 1.5ms 0.0%
WrapVerticalFusionRegion 0.6ms 0.0%
OptimizeConcat 0.2ms 0.0%
SplitGRUSequence 0.1ms 0.0%
EnsureNCEOpsSizeRequirements 0.1ms 0.0%
func.func' Pipeline 1221.7ms 1.8% UnrollDistributedOps 367.8ms 0.6%
SegmentHalos 168.7ms 0.3%
DetectDMASplitCandidate 164.5ms 0.2%
SplitDMAToBalanceLoad 130.6ms 0.2%
FlattenSparseWeightsTypes 104.7ms 0.2%
NNDMATiling 73.4ms 0.1%
ComputeHaloRegionForDPUTaskOp 71.6ms 0.1%
UnrollSwKernel 49.4ms 0.1%
ComputeSESizes 18.8ms 0.0%
UnrollDMAAnalysis 16.9ms 0.0% (A) vpux::VPUIP::UnrollDMAAnalysis 16.9ms 0.0%
AdjustInputDataForExplicitSETable 16.8ms 0.0%
UnrollShaveCacheOps 16.0ms 0.0%
BatchMatMulToMatMul 12.8ms 0.0%
MoveDeclarationsToTop 9.6ms 0.0%
UnrollPerAxisTileDMA 1.2ms 0.0%
func.func' Pipeline 1122.6ms 1.7% OptimizeParallelCopies 394.7ms 0.6%
OptimizeCopies 352.3ms 0.5%
OptimizeConcatViewCopies 117.9ms 0.2%
OptimizeConvertDMAOp 94.2ms 0.1%
FuseDDRCopiesIntoConcats 55.5ms 0.1%
OptimizeTileOpAsNNDMA 47.8ms 0.1%
InsertCopyForEltwiseInPlaceInput 17.2ms 0.0% (A) vpux::AliasesInfo 12.4ms 0.0%
FuseLastCopy 16.2ms 0.0% (A) vpux::AliasesInfo 12.5ms 0.0%
UniquifyWeightsTableCopies 10.0ms 0.0%
ConvertToDMA 9.4ms 0.0%
OptimizeSubviewCopies 4.3ms 0.0%
ConvertDynamicReshapeToInPlace 2.8ms 0.0%
func.func' Pipeline 547.0ms 0.8% SplitNCEOpsOntoWorkloads 509.4ms 0.8%
ComputeNCEInputWorkloads 24.7ms 0.0%
CorrectNCEWorkloads 7.7ms 0.0%
ShiftOutputWorkloadsForHalo 2.3ms 0.0%
MoveTensorOpsToCMX 1.5ms 0.0%
MoveReflectPadToCMX 1.3ms 0.0%
func.func' Pipeline 474.9ms 0.7% RelocateWeightTableForReuse 236.3ms 0.4%
MakeOpsWithDistributedTensor 172.7ms 0.3% (A) vpux::VPU::SiblingOpsAnalysis 0.2ms 0.0%
MakeDistributedCopies 26.7ms 0.0%
OptimizeConcat 14.5ms 0.0%
OptimizeSharedInputCopyForConcat 13.6ms 0.0%
AdjustDistributedTensorAroundOps 6.0ms 0.0%
AdjustMemorySpace 2.9ms 0.0%
ComputeInterpolateCoordinates 1.7ms 0.0%
RemoveOutputSparseToAvoidSuboptimalDPUWorkloadsPass 0.5ms 0.0%
Canonicalizer 439.3ms 0.7%
func.func' Pipeline 383.5ms 0.6% TileActShaveKernelTask 175.1ms 0.3%
MovePureViewOpBeforeCopy 145.6ms 0.2%
ConvertSprLUTToConst 19.1ms 0.0%
WrapWithPermuteAsNNDMA 18.3ms 0.0%
OptimizeExpandSubview 9.1ms 0.0%
SetZeroOffsetWeightsTable 8.2ms 0.0%
ConvertExpand 8.0ms 0.0%
func.func' Pipeline 307.5ms 0.5% InferenceExecutionAnalysis 307.5ms 0.5%
Canonicalizer 283.3ms 0.4%
func.func' Pipeline 244.1ms 0.4% UngroupBufferSectionRewriterExecutor 143.0ms 0.2%
UngroupBoundedBuffers 87.0ms 0.1%
ComputeSEBasePtrs 5.1ms 0.0%
ConvertSETablesToConstants 4.6ms 0.0%
PropagateSparsityCompression 4.5ms 0.0%
OneShotBufferizeVPU2VPUIP 221.5ms 0.3%
func.func' Pipeline 174.7ms 0.3% OutputPipelineTiling 94.2ms 0.1%
ApplyTiling 80.5ms 0.1%
ManualStrategyUtils 0.1ms 0.0%
Canonicalizer 143.2ms 0.2%
SetMemorySpace 125.7ms 0.2% (A) vpux::AliasesInfo 37.1ms 0.1%
Canonicalizer 105.1ms 0.2%
Canonicalizer 104.6ms 0.2%
Canonicalizer 95.4ms 0.1%
func.func' Pipeline 95.3ms 0.1% func.func' Pipeline 89.0ms 0.1% ConvertViewOpsToDeclarations 89.0ms 0.1% (A) vpux::AliasesInfo 16.2ms 0.0%
Canonicalizer 79.2ms 0.1%
Canonicalizer 75.8ms 0.1%
func.func' Pipeline 59.3ms 0.1% ConvertTransferOpsToDMAs 59.3ms 0.1%
func.func' Pipeline 52.5ms 0.1% ConvertEltwiseToInPlace 52.5ms 0.1% (A) vpux::AliasesInfo 43.4ms 0.1%
Canonicalizer 44.4ms 0.1%
Canonicalizer 35.4ms 0.1%
func.func' Pipeline 34.4ms 0.1% LegalizeRepeatingFuncCalls 17.9ms 0.0%
FuseConstants 8.5ms 0.0%
ConvWeightsCompression 4.6ms 0.0%
ComputeSESizes 3.3ms 0.0%
AddCopyBetweenSWKernelsAndNetworkIO 26.1ms 0.0%
Canonicalizer 19.9ms 0.0%
UngroupHostBuffersAsFuncArgs 16.3ms 0.0%
AddBuffersForNetResults 15.5ms 0.0%
ConvertFuncArgsToDeclarations 14.3ms 0.0%
AdjustDynamicOpsBeforeBufferization 11.5ms 0.0%
func.func' Pipeline 11.3ms 0.0% UngroupBoundedBuffersAsFuncArgs 8.8ms 0.0%
func.func' Pipeline 6.9ms 0.0% LegalizeDynamicShapeConcatForSWLayers 3.5ms 0.0%
AdjustMemorySpaceForSHVOps 3.4ms 0.0%
func.func' Pipeline 5.6ms 0.0% ConvertIEToVPUNCE 4.7ms 0.0%
ConvertLayers2VPU 0.7ms 0.0%
ConvertDynamicQuantToVPUNCE 0.2ms 0.0%
func.func' Pipeline 5.6ms 0.0% CorrectStorageElementTableSeSizeForSEPDWConv 5.4ms 0.0%
UnrollFlashSDPA 0.2ms 0.0%
BoundedTensorsToDynamicDimsMask 5.2ms 0.0%
QueryArgsAllocationAnalysis 2.7ms 0.0% (A) vpux::ReservedMemInfo 2.7ms 0.0% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 2.1ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 2.0ms 0.0%
(A) vpux::AllocationInfo 0.3ms 0.0%
ConvertPrecisionToFP16 2.1ms 0.0%
func.func' Pipeline 2.0ms 0.0% InputQuantizationRestoration 1.8ms 0.0%
PropagateAndCleanUpFQ 0.1ms 0.0%
ConvertVariadicSplitToStridedSlice 0.1ms 0.0%
func.func' Pipeline 2.0ms 0.0% MemPermuteProcessingPipelineRewriterExecutor 1.7ms 0.0%
ConvertMemPermuteToOpPass 0.3ms 0.0%
func.func' Pipeline 1.8ms 0.0% ConvertExtractImagePatches 0.7ms 0.0%
ConvertFCToConv 0.4ms 0.0%
MergeParallelFullyConnected 0.1ms 0.0%
UnrollGroupQuantize 0.1ms 0.0%
SwapOperationWithGather 0.1ms 0.0%
MergeFullyConnected 0.1ms 0.0%
ConvertReduceToPooling 0.1ms 0.0%
ConvertGather 0.1ms 0.0%
func.func' Pipeline 1.8ms 0.0% SwapOperations 0.8ms 0.0%
PropagateAffineReshape 0.5ms 0.0%
UniquifyBranches 0.2ms 0.0%
UniquifySimilarOps 0.1ms 0.0%
PropagateExpand 0.1ms 0.0%
func.func' Pipeline 1.7ms 0.0% ConvertWeightsToU8 0.4ms 0.0%
ConvertWeightsToU8 0.4ms 0.0%
FuseActivationOps 0.2ms 0.0%
PropagateAndFuseQuantizeDequantize 0.1ms 0.0%
ConvertToMixedPrecision 0.1ms 0.0%
ConvertWeightsToI4 0.1ms 0.0%
ConvertToMixedPrecision 0.1ms 0.0%
Canonicalizer 1.7ms 0.0%
func.func' Pipeline 1.6ms 0.0% AdjustForVPUPipelineRewriterExecutor 0.6ms 0.0%
SwapOperations 0.5ms 0.0%
ConvertScatter 0.2ms 0.0%
ConvertBroadcastToTile 0.1ms 0.0%
ConvertPadToConcat 0.1ms 0.0%
func.func' Pipeline 1.6ms 0.0% func.func' Pipeline 1.4ms 0.0% OptimizeActivationsPipelineRewriterExecutor 1.1ms 0.0%
ConvertShapeTo4D 0.1ms 0.0%
SwapViewOpAndClamp 0.1ms 0.0%
SwapConvertWithSWOp 0.1ms 0.0%
func.func' Pipeline 1.3ms 0.0% ConvertShapeTo4D 0.5ms 0.0%
HandleLargeKernels 0.3ms 0.0%
AdaptShapesForScaleShiftPass 0.3ms 0.0%
AdaptShapesForScaleShiftPass 0.1ms 0.0%
func.func' Pipeline 1.3ms 0.0% PropagateAffineReshape 0.7ms 0.0%
PropagateTranspose 0.3ms 0.0%
UniquifyBranches 0.3ms 0.0%
func.func' Pipeline 1.3ms 0.0% AdjustLayouts 1.0ms 0.0%
TransposeToPermuteCast 0.3ms 0.0%
func.func' Pipeline 1.2ms 0.0% BatchOpProcessingPipelineRewriterExecutor 1.1ms 0.0%
func.func' Pipeline 0.9ms 0.0% SwapOperations 0.5ms 0.0%
ConvertToScaleShift 0.2ms 0.0%
func.func' Pipeline 0.9ms 0.0% OptimizeReorders 0.9ms 0.0%
func.func' Pipeline 0.8ms 0.0% ExpandActivationChannels 0.3ms 0.0%
AdjustMemPermuteAroundOp 0.2ms 0.0%
UniquifySimilarOps 0.1ms 0.0%
AdjustConvolutionShape 0.1ms 0.0%
VerticalFusionOutlining 0.8ms 0.0%
func.func' Pipeline 0.7ms 0.0% SwapOperations 0.6ms 0.0%
ConvertSplitConcatToAffineReshape 0.1ms 0.0%
func.func' Pipeline 0.7ms 0.0% ConvertBatchedLayerTo1N 0.5ms 0.0%
UpstreamSlice 0.1ms 0.0%
func.func' Pipeline 0.7ms 0.0% AdjustConvolutionInputShape 0.3ms 0.0%
OptimizeSliceExpand 0.2ms 0.0%
AdjustInputShape 0.2ms 0.0%
AdjustConvolutionWeights 0.1ms 0.0%
func.func' Pipeline 0.7ms 0.0% EnsureNCEOpsSizeRequirements 0.3ms 0.0%
OptimizeConcat 0.2ms 0.0%
Canonicalizer 0.6ms 0.0%
func.func' Pipeline 0.6ms 0.0% PropagateMemPermuteBeforeOp 0.5ms 0.0%
LegalizeNDMemPermute 0.1ms 0.0%
Canonicalizer 0.6ms 0.0%
Canonicalizer 0.5ms 0.0%
func.func' Pipeline 0.5ms 0.0% HandleLargeKernels 0.2ms 0.0%
HandleLargeStrides 0.1ms 0.0%
ConvertStridedSlice2Conv 0.1ms 0.0%
SplitConvWithMultipleFQ 0.1ms 0.0%
Canonicalizer 0.5ms 0.0%
func.func' Pipeline 0.5ms 0.0% UniquifyBranches 0.3ms 0.0%
PropagateReorderToNCE 0.1ms 0.0%
Canonicalizer 0.5ms 0.0%
Canonicalizer 0.4ms 0.0%
func.func' Pipeline 0.4ms 0.0% UniquifySimilarOps 0.1ms 0.0%
AdjustConvolutionShape 0.1ms 0.0%
AdjustInputShape 0.1ms 0.0%
func.func' Pipeline 0.4ms 0.0% AdaptODUPermutePass 0.2ms 0.0%
PropagateShapeCast 0.1ms 0.0%
PropagatePermuteCast 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% SwapFakeQuantWithReshapeAndStridedSlice 0.1ms 0.0%
SwapConvertWithReshapeKindOps 0.1ms 0.0%
AlignScales 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% ConvertToMemPermute 0.2ms 0.0%
ConvertReorderToPermuteQuantize 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% PropagateAffineReshape 0.2ms 0.0%
OptimizeSliceExpand 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% ConvertScalarToTensor 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% OptimizeParallelLayers 0.1ms 0.0%
Canonicalizer 0.2ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
StopLocationVerifierPass 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% MovePermutePostEltwise 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% OptimizeSliceExpand 0.2ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
CSE 0.2ms 0.0%
CSE 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% DetectInPlaceEltwise 0.1ms 0.0%
SetupNpuConstraint 0.1ms 0.0%
DumpStatisticsOfIeOps 0.1ms 0.0%
StopLocationVerifierPass 0.1ms 0.0%
ResolveShapedTypeResultDimsPass 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% InitialLowPrecisionTransformationsPipelineRewriterExecutor 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
ConvertPrecisionToI32 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% Canonicalizer 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
OptimizePrecisionAcrossFunctionCalls 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% PropagateMemPermuteThroughEltwise 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% ConvertSplitConcatToTranspose 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% UniquifySimilarOps 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
DumpStatisticsOfIeOps 0.1ms 0.0%
ELF pipeline 11952.1ms 17.9% ConvertVPUMI40XX2VPUASM 3443.9ms 5.2%
func.func' Pipeline 2010.2ms 3.0% ReorderMPIOps 886.4ms 1.3%
AddBootstrapWorkItems 550.5ms 0.8%
AddBarrierConfigurationOps 172.9ms 0.3%
LinkEnqueueTargets 153.9ms 0.2%
UnrollFetchTaskOps 118.6ms 0.2%
UpdateEnqueueDMAInputAndOutput 51.6ms 0.1%
NextSameIdAssignment 41.8ms 0.1%
LinkEnqueueOpsForSameBarrier 34.5ms 0.1%
func.func' Pipeline 995.0ms 1.5% ConvertVPUIP2VPUMI40XX 994.9ms 1.5%
func.func' Pipeline 983.6ms 1.5% ReorderMPIOps 690.9ms 1.0%
ResolveWLMTaskLocation 89.0ms 0.1%
GroupExecutionOps 56.3ms 0.1%
PropagateFinalBarrier 56.1ms 0.1%
ConvertFetchDmasToFetchTaskOps 56.0ms 0.1%
UnGroupExecutionOps 35.2ms 0.1%
func.func' Pipeline 880.4ms 1.3% ExpandDPUConfig 880.3ms 1.3%
Canonicalizer 763.9ms 1.1%
ConvertVPUASM2NPUReg50XX 680.9ms 1.0%
ConvertVPUIPDPU2NPUReg50XX 651.1ms 1.0%
func.func' Pipeline 555.3ms 0.8% SetOpOffsets 351.8ms 0.5%
HandleAlignmentRequirements 203.5ms 0.3%
func.func' Pipeline 385.9ms 0.6% AddELFRelocations 351.2ms 0.5%
AddRelocationsForDynamicStridesDmas 34.7ms 0.1%
Canonicalizer 282.5ms 0.4%
UpdateELFSectionFlags 190.5ms 0.3%
DeduceDynamicMappedInferenceVersion 56.8ms 0.1%
func.func' Pipeline 35.9ms 0.1% AddMappedInferenceVersionOp 35.9ms 0.1%
SetupProfilingVPUMI40XX 24.7ms 0.0%
func.func' Pipeline 8.6ms 0.0% SetEntryPoint 6.1ms 0.0%
AddELFSymbolTable 2.4ms 0.0%
Build compilation pipeline 0.1ms 0.0%
HoistInputOutputs 0.1ms 0.0%
Import network 20.1ms 0.0% Common nGraph passes 17.9ms 0.0%
Import nGraph function 0.6ms 0.0%
Validate MLIR module 0.4ms 0.0%
Add NetworkInfo Operation 0.1ms 0.0%
Rest 1.4ms 0.0%
sub-model 2 8.8s 4% Compile network 8742.6ms 99.7% IE to VPUIP pipeline 6499.5ms 74.1% func.func' Pipeline 1727.9ms 19.7% SimplifySchedule 270.0ms 3.1% (A) vpux::BarrierInfo 6.2ms 0.1%
BarrierOptimization 247.6ms 2.8% (A) vpux::BarrierInfo 7.7ms 0.1%
AddPlaceholderFetchDMAs 199.4ms 2.3% (A) vpux::ExecutionGroupAnalysis 12.5ms 0.1%
(A) vpux::BarrierInfo 7.4ms 0.1%
WlmLegalizeSplitGraphToPages 158.4ms 1.8% (A) vpux::BarrierInfo 7.9ms 0.1%
FindWlmEnqueueDmasBarrier 151.0ms 1.7% (A) vpux::ExecutionGroupAnalysis 18.2ms 0.2%
(A) vpux::BarrierInfo 8.3ms 0.1%
WlmInsertDummyDmasInPages 135.3ms 1.5% (A) vpux::BarrierInfo 10.4ms 0.1%
WlmLegalizePagesForBarrierDmas 109.9ms 1.3% (A) vpux::BarrierInfo 10.4ms 0.1%
AddSwKernelInstructionPrefetch 95.9ms 1.1%
SplitControlGraph 66.1ms 0.8% (A) vpux::BarrierInfo 6.9ms 0.1%
SatisfyOneWaitBarrierPerTask 58.0ms 0.7% (A) vpux::BarrierInfo 6.6ms 0.1%
WlmSplitGraphToPages 50.3ms 0.6% (A) vpux::BarrierInfo 6.7ms 0.1%
OptimizeBarriersSlotsUsage 48.3ms 0.6% (A) vpux::BarrierInfo 9.1ms 0.1%
AssignPhysicalBarriers 47.5ms 0.5%
AddFinalBarrier 21.2ms 0.2%
WlmInsertDummyBarriersInPages 20.3ms 0.2% (A) vpux::BarrierInfo 10.3ms 0.1%
UpdateSwKernelParams 18.0ms 0.2%
AddStartBarrier 17.1ms 0.2% (A) vpux::BarrierInfo 6.5ms 0.1%
DMAOutOfOrderOptimization 7.4ms 0.1%
InsertDelayDPUVariant 5.9ms 0.1%
func.func' Pipeline 1555.5ms 17.7% MultiClusterStrategyAssignment 792.7ms 9.0%
TilingStrategyAssignment 672.0ms 7.7% (A) vpux::VPU::EagerSiblingOpsAnalysis 0.1ms 0.0%
MergeVfSubgraphs 89.3ms 1.0%
MoveViewOpsToVF 0.6ms 0.0%
WrapVerticalFusionRegion 0.4ms 0.0%
EnsureNCEOpsSizeRequirements 0.1ms 0.0%
OptimizeConcat 0.1ms 0.0%
ConvolutionSplitOverInputChannel 0.1ms 0.0%
DispatchedInliner 652.0ms 7.4%
func.func' Pipeline 450.2ms 5.1% FeasibleAllocation 316.0ms 3.6% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 8.0ms 0.1%
(A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 4.4ms 0.0%
(A) vpux::AsyncDepsInfo 2.8ms 0.0%
MoveViewOpsIntoAsyncRegions 51.1ms 0.6%
CalculateAsyncRegionCycleCost 44.8ms 0.5%
MoveWaitResultToAsyncBlockArgs 28.3ms 0.3% (A) vpux::AsyncDepsInfo 3.8ms 0.0%
WrapIntoAsyncRegions 9.6ms 0.1%
MoveDeclarationsToTop 0.4ms 0.0%
func.func' Pipeline 445.0ms 5.1% OutputPipelineTiling 437.3ms 5.0%
ApplyTiling 7.7ms 0.1%
func.func' Pipeline 328.9ms 3.8% SplitNCEOpsOntoWorkloads 312.8ms 3.6%
ComputeNCEInputWorkloads 10.2ms 0.1%
CorrectNCEWorkloads 5.5ms 0.1%
ShiftOutputWorkloadsForHalo 0.3ms 0.0%
MoveReflectPadToCMX 0.1ms 0.0%
MoveTensorOpsToCMX 0.1ms 0.0%
func.func' Pipeline 281.2ms 3.2% StaticAllocation 200.7ms 2.3% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 58.1ms 0.7% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 27.3ms 0.3%
(A) vpux::AsyncDepsInfo 7.6ms 0.1%
(A) vpux::AllocationInfo 0.1ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 0.1ms 0.0%
UngroupBoundedBuffers 27.5ms 0.3%
OptimizeAsyncDeps 24.5ms 0.3% (A) vpux::AsyncDepsInfo 3.9ms 0.0%
ConvertAsyncOpsToTasks 19.3ms 0.2%
LinearizeCallOps 2.7ms 0.0% (A) vpux::AsyncDepsInfo 2.3ms 0.0%
ConvertAllocationsToDeclarations 2.3ms 0.0%
PatchWeightsTable 2.0ms 0.0%
BreakDataFlow 1.5ms 0.0%
AddSwKernelCacheHandlingOps 0.7ms 0.0%
func.func' Pipeline 239.2ms 2.7% UnrollDistributedOps 112.7ms 1.3%
DetectDMASplitCandidate 71.2ms 0.8%
SplitDMAToBalanceLoad 19.2ms 0.2%
UnrollSwKernel 11.0ms 0.1%
NNDMATiling 9.7ms 0.1%
UnrollPerAxisTileDMA 7.7ms 0.1%
FlattenSparseWeightsTypes 4.1ms 0.0%
SegmentHalos 3.8ms 0.0%
ComputeHaloRegionForDPUTaskOp 2.5ms 0.0%
MoveDeclarationsToTop 1.6ms 0.0%
BatchMatMulToMatMul 1.4ms 0.0%
ComputeSESizes 0.7ms 0.0%
UnrollShaveCacheOps 0.7ms 0.0%
AdjustInputDataForExplicitSETable 0.6ms 0.0%
UnrollDMAAnalysis 0.5ms 0.0% (A) vpux::VPUIP::UnrollDMAAnalysis 0.5ms 0.0%
func.func' Pipeline 116.5ms 1.3% InferenceExecutionAnalysis 116.5ms 1.3%
func.func' Pipeline 101.2ms 1.2% OptimizeCopies 43.8ms 0.5%
OptimizeParallelCopies 21.5ms 0.2%
OptimizeConcatViewCopies 10.8ms 0.1%
OptimizeConvertDMAOp 10.2ms 0.1%
FuseDDRCopiesIntoConcats 5.3ms 0.1%
OptimizeTileOpAsNNDMA 5.1ms 0.1%
FuseLastCopy 1.4ms 0.0% (A) vpux::AliasesInfo 1.1ms 0.0%
InsertCopyForEltwiseInPlaceInput 1.4ms 0.0% (A) vpux::AliasesInfo 1.1ms 0.0%
ConvertToDMA 1.1ms 0.0%
UniquifyWeightsTableCopies 0.3ms 0.0%
OptimizeSubviewCopies 0.2ms 0.0%
ConvertDynamicReshapeToInPlace 0.2ms 0.0%
func.func' Pipeline 84.9ms 1.0% TileActShaveKernelTask 63.7ms 0.7%
MovePureViewOpBeforeCopy 13.4ms 0.2%
ConvertSprLUTToConst 3.5ms 0.0%
SetZeroOffsetWeightsTable 2.0ms 0.0%
WrapWithPermuteAsNNDMA 1.3ms 0.0%
OptimizeExpandSubview 0.6ms 0.0%
ConvertExpand 0.4ms 0.0%
OneShotBufferizeVPU2VPUIP 72.4ms 0.8%
Canonicalizer 70.3ms 0.8%
func.func' Pipeline 56.5ms 0.6% MakeOpsWithDistributedTensor 30.2ms 0.3%
RelocateWeightTableForReuse 16.8ms 0.2%
MakeDistributedCopies 4.1ms 0.0%
OptimizeSharedInputCopyForConcat 2.1ms 0.0%
OptimizeConcat 2.0ms 0.0%
AdjustDistributedTensorAroundOps 0.7ms 0.0%
AdjustMemorySpace 0.5ms 0.0%
ComputeInterpolateCoordinates 0.2ms 0.0%
Canonicalizer 36.2ms 0.4%
Canonicalizer 22.6ms 0.3%
func.func' Pipeline 21.2ms 0.2% func.func' Pipeline 17.7ms 0.2% ConvertViewOpsToDeclarations 17.7ms 0.2% (A) vpux::AliasesInfo 2.2ms 0.0%
SetMemorySpace 16.5ms 0.2% (A) vpux::AliasesInfo 5.2ms 0.1%
func.func' Pipeline 15.3ms 0.2% UngroupBoundedBuffers 7.8ms 0.1%
UngroupBufferSectionRewriterExecutor 6.7ms 0.1%
ComputeSEBasePtrs 0.4ms 0.0%
ConvertSETablesToConstants 0.2ms 0.0%
PropagateSparsityCompression 0.2ms 0.0%
Canonicalizer 14.7ms 0.2%
Canonicalizer 12.6ms 0.1%
Canonicalizer 10.2ms 0.1%
Canonicalizer 10.2ms 0.1%
Canonicalizer 10.1ms 0.1%
Canonicalizer 8.6ms 0.1%
Canonicalizer 8.3ms 0.1%
func.func' Pipeline 5.4ms 0.1% ConvertEltwiseToInPlace 5.4ms 0.1% (A) vpux::AliasesInfo 4.5ms 0.1%
Canonicalizer 4.4ms 0.1%
func.func' Pipeline 4.1ms 0.0% ConvertIEToVPUNCE 3.5ms 0.0%
ConvertLayers2VPU 0.5ms 0.0%
AddCopyBetweenSWKernelsAndNetworkIO 4.0ms 0.0%
func.func' Pipeline 3.9ms 0.0% ConvertTransferOpsToDMAs 3.9ms 0.0%
func.func' Pipeline 3.7ms 0.0% func.func' Pipeline 3.0ms 0.0% InputQuantizationRestoration 2.8ms 0.0%
PropagateAndCleanUpFQ 0.1ms 0.0%
ConvertVariadicSplitToStridedSlice 0.1ms 0.0%
AdjustDynamicOpsBeforeBufferization 2.9ms 0.0%
ConvertFuncArgsToDeclarations 2.7ms 0.0%
func.func' Pipeline 2.5ms 0.0% LegalizeRepeatingFuncCalls 1.5ms 0.0%
FuseConstants 0.6ms 0.0%
ConvWeightsCompression 0.2ms 0.0%
ComputeSESizes 0.2ms 0.0%
func.func' Pipeline 1.8ms 0.0% func.func' Pipeline 1.5ms 0.0% LegalizeDynamicShapeConcatForSWLayers 0.9ms 0.0%
AdjustMemorySpaceForSHVOps 0.6ms 0.0%
func.func' Pipeline 1.2ms 0.0% EnsureNCEOpsSizeRequirements 0.4ms 0.0%
SparsifyWeights 0.4ms 0.0%
OptimizeConcat 0.2ms 0.0%
func.func' Pipeline 1.0ms 0.0% CorrectStorageElementTableSeSizeForSEPDWConv 1.0ms 0.0%
func.func' Pipeline 0.9ms 0.0% ConvertShapeTo4D 0.5ms 0.0%
AdaptShapesForScaleShiftPass 0.1ms 0.0%
HandleLargeKernels 0.1ms 0.0%
AdaptShapesForScaleShiftPass 0.1ms 0.0%
func.func' Pipeline 0.9ms 0.0% ConvertWeightsToU8 0.2ms 0.0%
ConvertWeightsToU8 0.2ms 0.0%
PropagateAndFuseQuantizeDequantize 0.1ms 0.0%
FuseActivationOps 0.1ms 0.0%
ConvertToMixedPrecision 0.1ms 0.0%
ConvertWeightsToI4 0.1ms 0.0%
ConvertToMixedPrecision 0.1ms 0.0%
UngroupHostBuffersAsFuncArgs 0.9ms 0.0%
AddBuffersForNetResults 0.9ms 0.0%
ConvertPrecisionToFP16 0.8ms 0.0%
BoundedTensorsToDynamicDimsMask 0.8ms 0.0%
func.func' Pipeline 0.7ms 0.0% MemPermuteProcessingPipelineRewriterExecutor 0.6ms 0.0%
ConvertMemPermuteToOpPass 0.1ms 0.0%
Canonicalizer 0.6ms 0.0%
func.func' Pipeline 0.6ms 0.0% AdjustForVPUPipelineRewriterExecutor 0.3ms 0.0%
SwapOperations 0.1ms 0.0%
ConvertScatter 0.1ms 0.0%
func.func' Pipeline 0.6ms 0.0% PropagateAffineReshape 0.2ms 0.0%
SwapOperations 0.2ms 0.0%
UniquifySimilarOps 0.1ms 0.0%
Canonicalizer 0.6ms 0.0%
QueryArgsAllocationAnalysis 0.6ms 0.0% (A) vpux::ReservedMemInfo 0.6ms 0.0% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 0.5ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 0.5ms 0.0%
(A) vpux::AllocationInfo 0.1ms 0.0%
Canonicalizer 0.5ms 0.0%
func.func' Pipeline 0.5ms 0.0% ConvertShapeTo4D 0.2ms 0.0%
OptimizeActivationsPipelineRewriterExecutor 0.2ms 0.0%
func.func' Pipeline 0.5ms 0.0% AdjustMemPermuteAroundOp 0.2ms 0.0%
ExpandActivationChannels 0.2ms 0.0%
AdjustConvolutionShape 0.1ms 0.0%
UngroupBoundedBuffersAsFuncArgs 0.5ms 0.0%
func.func' Pipeline 0.4ms 0.0% ConvertFCToConv 0.1ms 0.0%
ConvertExtractImagePatches 0.1ms 0.0%
func.func' Pipeline 0.4ms 0.0% func.func' Pipeline 0.4ms 0.0% OptimizeReorders 0.4ms 0.0%
VerticalFusionOutlining 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
func.func' Pipeline 0.3ms 0.0% OptimizeParallelLayers 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% BatchOpProcessingPipelineRewriterExecutor 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% ConvertBranchesConcatToConv 0.1ms 0.0%
SwapOperations 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% SwapOperations 0.1ms 0.0%
ConvertToScaleShift 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% PropagateAffineReshape 0.2ms 0.0%
PropagateTranspose 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% OptimizeSliceExpand 0.1ms 0.0%
AdjustConvolutionInputShape 0.1ms 0.0%
AdjustInputShape 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% ConvertScalarToTensor 0.1ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% HandleLargeKernels 0.1ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% SwapFakeQuantWithReshapeAndStridedSlice 0.1ms 0.0%
AlignScales 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% ConvertToMemPermute 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% MovePermutePostEltwise 0.1ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% PropagateMemPermuteBeforeOp 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% AdjustConvolutionShape 0.1ms 0.0%
AdjustInputShape 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% PropagateAffineReshape 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% AdaptODUPermutePass 0.1ms 0.0%
PropagateShapeCast 0.1ms 0.0%
Canonicalizer 0.2ms 0.0%
InitResources 0.1ms 0.0%
DumpStatisticsOfIeOps 0.1ms 0.0%
StopLocationVerifierPass 0.1ms 0.0%
ResolveShapedTypeResultDimsPass 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% InitialLowPrecisionTransformationsPipelineRewriterExecutor 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
ConvertPrecisionToI32 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
StopLocationVerifierPass 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% ConvertScaleShiftToDW 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
OptimizePrecisionAcrossFunctionCalls 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% UniquifyBranches 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% PropagateMemPermuteThroughEltwise 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% OptimizeSliceExpand 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
DumpStatisticsOfIeOps 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
ELF pipeline 2243.2ms 25.6% ConvertVPUMI40XX2VPUASM 697.6ms 8.0%
func.func' Pipeline 268.7ms 3.1% ReorderMPIOps 115.6ms 1.3%
AddBootstrapWorkItems 61.1ms 0.7%
LinkEnqueueTargets 30.0ms 0.3%
AddBarrierConfigurationOps 20.8ms 0.2%
UnrollFetchTaskOps 18.1ms 0.2%
UpdateEnqueueDMAInputAndOutput 10.8ms 0.1%
NextSameIdAssignment 6.3ms 0.1%
LinkEnqueueOpsForSameBarrier 5.8ms 0.1%
func.func' Pipeline 207.6ms 2.4% ConvertVPUIP2VPUMI40XX 207.6ms 2.4%
func.func' Pipeline 162.1ms 1.8% ExpandDPUConfig 161.9ms 1.8%
func.func' Pipeline 148.4ms 1.7% ReorderMPIOps 101.1ms 1.2%
ResolveWLMTaskLocation 13.7ms 0.2%
GroupExecutionOps 9.8ms 0.1%
ConvertFetchDmasToFetchTaskOps 9.5ms 0.1%
PropagateFinalBarrier 7.5ms 0.1%
UnGroupExecutionOps 6.7ms 0.1%
ConvertVPUASM2NPUReg50XX 147.3ms 1.7%
func.func' Pipeline 125.5ms 1.4% AddELFRelocations 116.7ms 1.3%
AddRelocationsForDynamicStridesDmas 8.8ms 0.1%
Canonicalizer 122.7ms 1.4%
ConvertVPUIPDPU2NPUReg50XX 116.4ms 1.3%
func.func' Pipeline 107.5ms 1.2% SetOpOffsets 67.7ms 0.8%
HandleAlignmentRequirements 39.8ms 0.5%
Canonicalizer 60.7ms 0.7%
UpdateELFSectionFlags 45.6ms 0.5%
DeduceDynamicMappedInferenceVersion 16.4ms 0.2%
func.func' Pipeline 4.8ms 0.1% AddMappedInferenceVersionOp 4.8ms 0.1%
SetupProfilingVPUMI40XX 4.0ms 0.0%
func.func' Pipeline 2.8ms 0.0% SetEntryPoint 1.7ms 0.0%
AddELFSymbolTable 1.1ms 0.0%
Build compilation pipeline 0.1ms 0.0%
HoistInputOutputs 0.1ms 0.0%
Import network 21.9ms 0.2% Common nGraph passes 19.7ms 0.2%
Import nGraph function 0.6ms 0.0%
Validate MLIR module 0.4ms 0.0%
Add NetworkInfo Operation 0.2ms 0.0%
Rest 1.5ms 0.0%
sub-model 3 7.7s 3% Compile network 7697.8ms 99.7% IE to VPUIP pipeline 5703.9ms 73.9% func.func' Pipeline 1470.4ms 19.0% SimplifySchedule 225.8ms 2.9% (A) vpux::BarrierInfo 4.8ms 0.1%
BarrierOptimization 224.9ms 2.9% (A) vpux::BarrierInfo 5.8ms 0.1%
AddPlaceholderFetchDMAs 166.6ms 2.2% (A) vpux::ExecutionGroupAnalysis 10.1ms 0.1%
(A) vpux::BarrierInfo 6.1ms 0.1%
WlmLegalizeSplitGraphToPages 132.8ms 1.7% (A) vpux::BarrierInfo 6.3ms 0.1%
FindWlmEnqueueDmasBarrier 123.0ms 1.6% (A) vpux::ExecutionGroupAnalysis 13.9ms 0.2%
(A) vpux::BarrierInfo 6.3ms 0.1%
WlmInsertDummyDmasInPages 117.3ms 1.5% (A) vpux::BarrierInfo 8.6ms 0.1%
WlmLegalizePagesForBarrierDmas 92.0ms 1.2% (A) vpux::BarrierInfo 8.9ms 0.1%
AddSwKernelInstructionPrefetch 88.7ms 1.1%
SplitControlGraph 53.7ms 0.7% (A) vpux::BarrierInfo 5.4ms 0.1%
SatisfyOneWaitBarrierPerTask 48.8ms 0.6% (A) vpux::BarrierInfo 5.1ms 0.1%
AssignPhysicalBarriers 41.0ms 0.5%
WlmSplitGraphToPages 40.1ms 0.5% (A) vpux::BarrierInfo 5.2ms 0.1%
OptimizeBarriersSlotsUsage 38.8ms 0.5% (A) vpux::BarrierInfo 6.8ms 0.1%
WlmInsertDummyBarriersInPages 18.8ms 0.2% (A) vpux::BarrierInfo 8.8ms 0.1%
AddFinalBarrier 17.4ms 0.2%
UpdateSwKernelParams 15.5ms 0.2%
AddStartBarrier 13.5ms 0.2% (A) vpux::BarrierInfo 5.0ms 0.1%
DMAOutOfOrderOptimization 6.4ms 0.1%
InsertDelayDPUVariant 5.2ms 0.1%
func.func' Pipeline 1344.9ms 17.4% MultiClusterStrategyAssignment 691.6ms 9.0%
TilingStrategyAssignment 574.7ms 7.4% (A) vpux::VPU::EagerSiblingOpsAnalysis 0.1ms 0.0%
MergeVfSubgraphs 77.3ms 1.0%
MoveViewOpsToVF 0.5ms 0.0%
WrapVerticalFusionRegion 0.3ms 0.0%
EnsureNCEOpsSizeRequirements 0.1ms 0.0%
OptimizeConcat 0.1ms 0.0%
ConvolutionSplitOverInputChannel 0.1ms 0.0%
DispatchedInliner 580.5ms 7.5%
func.func' Pipeline 448.5ms 5.8% OutputPipelineTiling 441.7ms 5.7%
ApplyTiling 6.6ms 0.1%
func.func' Pipeline 392.0ms 5.1% FeasibleAllocation 274.4ms 3.6% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 5.9ms 0.1%
(A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 3.2ms 0.0%
(A) vpux::AsyncDepsInfo 2.9ms 0.0%
CalculateAsyncRegionCycleCost 43.1ms 0.6%
MoveViewOpsIntoAsyncRegions 35.6ms 0.5%
MoveWaitResultToAsyncBlockArgs 32.7ms 0.4% (A) vpux::AsyncDepsInfo 3.4ms 0.0%
WrapIntoAsyncRegions 5.9ms 0.1%
MoveDeclarationsToTop 0.3ms 0.0%
func.func' Pipeline 320.0ms 4.1% SplitNCEOpsOntoWorkloads 304.7ms 3.9%
ComputeNCEInputWorkloads 10.2ms 0.1%
CorrectNCEWorkloads 4.7ms 0.1%
ShiftOutputWorkloadsForHalo 0.2ms 0.0%
MoveReflectPadToCMX 0.1ms 0.0%
MoveTensorOpsToCMX 0.1ms 0.0%
func.func' Pipeline 250.4ms 3.2% StaticAllocation 183.5ms 2.4% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 53.7ms 0.7% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 26.2ms 0.3%
(A) vpux::AsyncDepsInfo 6.7ms 0.1%
(A) vpux::AllocationInfo 0.1ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 0.1ms 0.0%
UngroupBoundedBuffers 22.0ms 0.3%
OptimizeAsyncDeps 20.9ms 0.3% (A) vpux::AsyncDepsInfo 3.5ms 0.0%
ConvertAsyncOpsToTasks 17.0ms 0.2%
LinearizeCallOps 2.4ms 0.0% (A) vpux::AsyncDepsInfo 2.1ms 0.0%
ConvertAllocationsToDeclarations 1.8ms 0.0%
PatchWeightsTable 1.3ms 0.0%
BreakDataFlow 1.3ms 0.0%
AddSwKernelCacheHandlingOps 0.4ms 0.0%
func.func' Pipeline 202.9ms 2.6% UnrollDistributedOps 98.4ms 1.3%
DetectDMASplitCandidate 65.9ms 0.9%
SplitDMAToBalanceLoad 15.5ms 0.2%
UnrollPerAxisTileDMA 10.9ms 0.1%
NNDMATiling 7.5ms 0.1%
UnrollSwKernel 4.4ms 0.1%
FlattenSparseWeightsTypes 3.2ms 0.0%
SegmentHalos 2.9ms 0.0%
ComputeHaloRegionForDPUTaskOp 2.1ms 0.0%
BatchMatMulToMatMul 2.0ms 0.0%
UnrollShaveCacheOps 0.6ms 0.0%
ComputeSESizes 0.5ms 0.0%
AdjustInputDataForExplicitSETable 0.5ms 0.0%
MoveDeclarationsToTop 0.4ms 0.0%
UnrollDMAAnalysis 0.4ms 0.0% (A) vpux::VPUIP::UnrollDMAAnalysis 0.4ms 0.0%
func.func' Pipeline 123.2ms 1.6% OptimizeCopies 69.4ms 0.9%
OptimizeParallelCopies 20.1ms 0.3%
OptimizeConcatViewCopies 10.4ms 0.1%
OptimizeConvertDMAOp 9.0ms 0.1%
FuseDDRCopiesIntoConcats 4.7ms 0.1%
OptimizeTileOpAsNNDMA 4.5ms 0.1%
UniquifyWeightsTableCopies 1.2ms 0.0%
FuseLastCopy 1.2ms 0.0% (A) vpux::AliasesInfo 1.0ms 0.0%
InsertCopyForEltwiseInPlaceInput 1.2ms 0.0% (A) vpux::AliasesInfo 0.9ms 0.0%
ConvertToDMA 1.0ms 0.0%
OptimizeSubviewCopies 0.2ms 0.0%
ConvertDynamicReshapeToInPlace 0.1ms 0.0%
func.func' Pipeline 109.6ms 1.4% InferenceExecutionAnalysis 109.5ms 1.4%
func.func' Pipeline 65.0ms 0.8% TileActShaveKernelTask 48.3ms 0.6%
MovePureViewOpBeforeCopy 16.7ms 0.2%
ConvertSprLUTToConst 1.9ms 0.0%
WrapWithPermuteAsNNDMA 1.1ms 0.0%
SetZeroOffsetWeightsTable 0.8ms 0.0%
OptimizeExpandSubview 0.5ms 0.0%
ConvertExpand 0.3ms 0.0%
Canonicalizer 60.1ms 0.8%
OneShotBufferizeVPU2VPUIP 42.5ms 0.6%
func.func' Pipeline 38.0ms 0.5% MakeOpsWithDistributedTensor 22.1ms 0.3%
RelocateWeightTableForReuse 9.6ms 0.1%
MakeDistributedCopies 2.8ms 0.0%
OptimizeSharedInputCopyForConcat 1.3ms 0.0%
OptimizeConcat 1.3ms 0.0%
AdjustDistributedTensorAroundOps 0.4ms 0.0%
AdjustMemorySpace 0.4ms 0.0%
ComputeInterpolateCoordinates 0.1ms 0.0%
Canonicalizer 29.1ms 0.4%
func.func' Pipeline 18.5ms 0.2% Canonicalizer 18.3ms 0.2%
SetMemorySpace 14.6ms 0.2% (A) vpux::AliasesInfo 4.1ms 0.1%
func.func' Pipeline 12.7ms 0.2% UngroupBoundedBuffers 6.6ms 0.1%
UngroupBufferSectionRewriterExecutor 5.6ms 0.1%
ComputeSEBasePtrs 0.2ms 0.0%
ConvertSETablesToConstants 0.2ms 0.0%
PropagateSparsityCompression 0.2ms 0.0%
Canonicalizer 12.6ms 0.2%
Canonicalizer 11.4ms 0.1%
Canonicalizer 9.2ms 0.1%
func.func' Pipeline 8.6ms 0.1% ConvertViewOpsToDeclarations 8.6ms 0.1% (A) vpux::AliasesInfo 1.0ms 0.0%
Canonicalizer 8.4ms 0.1%
Canonicalizer 5.7ms 0.1%
Canonicalizer 4.6ms 0.1%
Canonicalizer 4.4ms 0.1%
func.func' Pipeline 4.2ms 0.1% Canonicalizer 3.8ms 0.0%
func.func' Pipeline 3.6ms 0.0% ConvertIEToVPUNCE 3.1ms 0.0%
ConvertLayers2VPU 0.4ms 0.0%
AddCopyBetweenSWKernelsAndNetworkIO 3.5ms 0.0%
func.func' Pipeline 3.4ms 0.0% LegalizeRepeatingFuncCalls 1.9ms 0.0%
FuseConstants 0.9ms 0.0%
ConvWeightsCompression 0.3ms 0.0%
ComputeSESizes 0.3ms 0.0%
func.func' Pipeline 3.0ms 0.0% func.func' Pipeline 2.8ms 0.0% ConvertTransferOpsToDMAs 2.8ms 0.0%
ConvertFuncArgsToDeclarations 2.1ms 0.0%
func.func' Pipeline 1.8ms 0.0% ConvertEltwiseToInPlace 1.8ms 0.0% (A) vpux::AliasesInfo 1.4ms 0.0%
func.func' Pipeline 1.7ms 0.0% InputQuantizationRestoration 1.5ms 0.0%
PropagateAndCleanUpFQ 0.1ms 0.0%
ConvertVariadicSplitToStridedSlice 0.1ms 0.0%
AdjustDynamicOpsBeforeBufferization 1.3ms 0.0%
func.func' Pipeline 0.9ms 0.0% EnsureNCEOpsSizeRequirements 0.4ms 0.0%
OptimizeConcat 0.2ms 0.0%
SparsifyWeights 0.2ms 0.0%
func.func' Pipeline 0.8ms 0.0% ConvertShapeTo4D 0.4ms 0.0%
AdaptShapesForScaleShiftPass 0.1ms 0.0%
HandleLargeKernels 0.1ms 0.0%
AdaptShapesForScaleShiftPass 0.1ms 0.0%
func.func' Pipeline 0.8ms 0.0% ConvertWeightsToU8 0.2ms 0.0%
ConvertWeightsToU8 0.2ms 0.0%
PropagateAndFuseQuantizeDequantize 0.1ms 0.0%
FuseActivationOps 0.1ms 0.0%
ConvertToMixedPrecision 0.1ms 0.0%
ConvertWeightsToI4 0.1ms 0.0%
func.func' Pipeline 0.8ms 0.0% CorrectStorageElementTableSeSizeForSEPDWConv 0.8ms 0.0%
AddBuffersForNetResults 0.8ms 0.0%
ConvertPrecisionToFP16 0.7ms 0.0%
Canonicalizer 0.7ms 0.0%
BoundedTensorsToDynamicDimsMask 0.7ms 0.0%
UngroupHostBuffersAsFuncArgs 0.7ms 0.0%
Canonicalizer 0.6ms 0.0%
func.func' Pipeline 0.5ms 0.0% AdjustForVPUPipelineRewriterExecutor 0.2ms 0.0%
SwapOperations 0.1ms 0.0%
ConvertScatter 0.1ms 0.0%
func.func' Pipeline 0.5ms 0.0% OptimizeActivationsPipelineRewriterExecutor 0.3ms 0.0%
ConvertShapeTo4D 0.2ms 0.0%
func.func' Pipeline 0.5ms 0.0% PropagateAffineReshape 0.2ms 0.0%
SwapOperations 0.2ms 0.0%
func.func' Pipeline 0.5ms 0.0% MemPermuteProcessingPipelineRewriterExecutor 0.5ms 0.0%
ConvertMemPermuteToOpPass 0.1ms 0.0%
QueryArgsAllocationAnalysis 0.5ms 0.0% (A) vpux::ReservedMemInfo 0.5ms 0.0% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 0.3ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 0.3ms 0.0%
(A) vpux::AllocationInfo 0.1ms 0.0%
Canonicalizer 0.4ms 0.0%
func.func' Pipeline 0.4ms 0.0% func.func' Pipeline 0.4ms 0.0% ExpandActivationChannels 0.2ms 0.0%
AdjustMemPermuteAroundOp 0.1ms 0.0%
VerticalFusionOutlining 0.4ms 0.0%
func.func' Pipeline 0.4ms 0.0% LegalizeDynamicShapeConcatForSWLayers 0.2ms 0.0%
AdjustMemorySpaceForSHVOps 0.2ms 0.0%
func.func' Pipeline 0.3ms 0.0% ConvertFCToConv 0.1ms 0.0%
ConvertExtractImagePatches 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% ConvertBranchesConcatToConv 0.1ms 0.0%
SwapOperations 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% SwapOperations 0.1ms 0.0%
ConvertToScaleShift 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% PropagateAffineReshape 0.1ms 0.0%
PropagateTranspose 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% OptimizeReorders 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% OptimizeSliceExpand 0.1ms 0.0%
AdjustInputShape 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% ConvertScalarToTensor 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% OptimizeParallelLayers 0.1ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% BatchOpProcessingPipelineRewriterExecutor 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% HandleLargeKernels 0.1ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% PropagateMemPermuteBeforeOp 0.1ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% AdjustInputShape 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% PropagateAffineReshape 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% AdaptODUPermutePass 0.1ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
UngroupBoundedBuffersAsFuncArgs 0.2ms 0.0%
SetupNpuConstraint 0.1ms 0.0%
DumpStatisticsOfIeOps 0.1ms 0.0%
StopLocationVerifierPass 0.1ms 0.0%
ResolveShapedTypeResultDimsPass 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% InitialLowPrecisionTransformationsPipelineRewriterExecutor 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
ConvertPrecisionToI32 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% ConvertScaleShiftToDW 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% UniquifyBranches 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% ConvertToMemPermute 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% MovePermutePostEltwise 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% OptimizeSliceExpand 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
DumpStatisticsOfIeOps 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
ELF pipeline 1993.9ms 25.8% ConvertVPUMI40XX2VPUASM 625.7ms 8.1%
func.func' Pipeline 219.3ms 2.8% ReorderMPIOps 95.1ms 1.2%
AddBootstrapWorkItems 47.4ms 0.6%
LinkEnqueueTargets 26.5ms 0.3%
AddBarrierConfigurationOps 16.4ms 0.2%
UnrollFetchTaskOps 14.3ms 0.2%
UpdateEnqueueDMAInputAndOutput 8.9ms 0.1%
NextSameIdAssignment 5.5ms 0.1%
LinkEnqueueOpsForSameBarrier 5.2ms 0.1%
func.func' Pipeline 187.0ms 2.4% ConvertVPUIP2VPUMI40XX 186.9ms 2.4%
func.func' Pipeline 149.8ms 1.9% ExpandDPUConfig 149.3ms 1.9%
ConvertVPUASM2NPUReg50XX 138.3ms 1.8%
func.func' Pipeline 125.4ms 1.6% ReorderMPIOps 85.5ms 1.1%
ResolveWLMTaskLocation 12.4ms 0.2%
GroupExecutionOps 8.6ms 0.1%
ConvertFetchDmasToFetchTaskOps 7.5ms 0.1%
PropagateFinalBarrier 5.8ms 0.1%
UnGroupExecutionOps 5.5ms 0.1%
func.func' Pipeline 108.8ms 1.4% AddELFRelocations 100.9ms 1.3%
AddRelocationsForDynamicStridesDmas 7.9ms 0.1%
ConvertVPUIPDPU2NPUReg50XX 107.4ms 1.4%
Canonicalizer 106.6ms 1.4%
func.func' Pipeline 97.8ms 1.3% SetOpOffsets 61.5ms 0.8%
HandleAlignmentRequirements 36.2ms 0.5%
Canonicalizer 57.2ms 0.7%
UpdateELFSectionFlags 40.1ms 0.5%
DeduceDynamicMappedInferenceVersion 15.6ms 0.2%
SetupProfilingVPUMI40XX 4.2ms 0.1%
func.func' Pipeline 4.1ms 0.1% AddMappedInferenceVersionOp 4.1ms 0.1%
func.func' Pipeline 1.8ms 0.0% SetEntryPoint 1.6ms 0.0%
AddELFSymbolTable 0.2ms 0.0%
Build compilation pipeline 0.1ms 0.0%
HoistInputOutputs 0.1ms 0.0%
Import network 19.3ms 0.2% Common nGraph passes 17.3ms 0.2%
Import nGraph function 0.5ms 0.0%
Validate MLIR module 0.3ms 0.0%
Add NetworkInfo Operation 0.1ms 0.0%
Rest 1.4ms 0.0%
sub-model 1 7.4s 3% Compile network 7364.0ms 99.5% IE to VPUIP pipeline 4889.1ms 66.1% func.func' Pipeline 1885.7ms 25.5% BarrierOptimization 285.0ms 3.9% (A) vpux::BarrierInfo 7.9ms 0.1%
SimplifySchedule 261.1ms 3.5% (A) vpux::BarrierInfo 7.0ms 0.1%
AddPlaceholderFetchDMAs 226.8ms 3.1% (A) vpux::ExecutionGroupAnalysis 14.1ms 0.2%
(A) vpux::BarrierInfo 8.3ms 0.1%
WlmLegalizeSplitGraphToPages 189.8ms 2.6% (A) vpux::BarrierInfo 8.7ms 0.1%
FindWlmEnqueueDmasBarrier 174.8ms 2.4% (A) vpux::ExecutionGroupAnalysis 19.2ms 0.3%
(A) vpux::BarrierInfo 12.9ms 0.2%
WlmInsertDummyDmasInPages 145.9ms 2.0% (A) vpux::BarrierInfo 11.1ms 0.2%
WlmLegalizePagesForBarrierDmas 120.0ms 1.6% (A) vpux::BarrierInfo 11.5ms 0.2%
SplitControlGraph 75.5ms 1.0% (A) vpux::BarrierInfo 8.8ms 0.1%
AddSwKernelInstructionPrefetch 67.0ms 0.9%
SatisfyOneWaitBarrierPerTask 65.8ms 0.9% (A) vpux::BarrierInfo 7.6ms 0.1%
OptimizeBarriersSlotsUsage 59.4ms 0.8% (A) vpux::BarrierInfo 10.7ms 0.1%
WlmSplitGraphToPages 58.1ms 0.8% (A) vpux::BarrierInfo 8.2ms 0.1%
AssignPhysicalBarriers 55.9ms 0.8%
WlmInsertDummyBarriersInPages 22.8ms 0.3% (A) vpux::BarrierInfo 11.7ms 0.2%
AddFinalBarrier 22.7ms 0.3%
UpdateSwKernelParams 20.0ms 0.3%
AddStartBarrier 19.7ms 0.3% (A) vpux::BarrierInfo 7.6ms 0.1%
DMAOutOfOrderOptimization 8.2ms 0.1%
InsertDelayDPUVariant 6.7ms 0.1%
DispatchedInliner 705.2ms 9.5%
func.func' Pipeline 394.5ms 5.3% FeasibleAllocation 318.8ms 4.3% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 8.4ms 0.1%
(A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 4.7ms 0.1%
(A) vpux::AsyncDepsInfo 2.9ms 0.0%
MoveWaitResultToAsyncBlockArgs 26.5ms 0.4% (A) vpux::AsyncDepsInfo 4.8ms 0.1%
MoveViewOpsIntoAsyncRegions 26.0ms 0.4%
CalculateAsyncRegionCycleCost 17.7ms 0.2%
WrapIntoAsyncRegions 5.1ms 0.1%
MoveDeclarationsToTop 0.4ms 0.0%
func.func' Pipeline 282.0ms 3.8% MultiClusterStrategyAssignment 131.0ms 1.8%
MergeVfSubgraphs 83.8ms 1.1%
TilingStrategyAssignment 65.4ms 0.9% (A) vpux::VPU::EagerSiblingOpsAnalysis 0.1ms 0.0%
MoveViewOpsToVF 0.8ms 0.0%
WrapVerticalFusionRegion 0.4ms 0.0%
OptimizeConcat 0.2ms 0.0%
ConvolutionSplitOverInputChannel 0.2ms 0.0%
EnsureNCEOpsSizeRequirements 0.1ms 0.0%
UnrollUnusedVerticalFusionRegion 0.1ms 0.0%
func.func' Pipeline 279.8ms 3.8% StaticAllocation 199.3ms 2.7% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 54.6ms 0.7% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 29.8ms 0.4%
(A) vpux::AsyncDepsInfo 7.8ms 0.1%
(A) vpux::AllocationInfo 0.1ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 0.1ms 0.0%
UngroupBoundedBuffers 27.2ms 0.4%
OptimizeAsyncDeps 24.9ms 0.3% (A) vpux::AsyncDepsInfo 3.9ms 0.1%
ConvertAsyncOpsToTasks 19.6ms 0.3%
LinearizeCallOps 2.6ms 0.0% (A) vpux::AsyncDepsInfo 2.3ms 0.0%
ConvertAllocationsToDeclarations 2.2ms 0.0%
PatchWeightsTable 1.9ms 0.0%
BreakDataFlow 1.5ms 0.0%
AddSwKernelCacheHandlingOps 0.6ms 0.0%
func.func' Pipeline 278.5ms 3.8% SplitNCEOpsOntoWorkloads 262.4ms 3.5%
ComputeNCEInputWorkloads 10.1ms 0.1%
CorrectNCEWorkloads 5.5ms 0.1%
ShiftOutputWorkloadsForHalo 0.3ms 0.0%
MoveReflectPadToCMX 0.2ms 0.0%
MoveTensorOpsToCMX 0.1ms 0.0%
func.func' Pipeline 173.7ms 2.3% UnrollDistributedOps 82.2ms 1.1%
DetectDMASplitCandidate 44.1ms 0.6%
SplitDMAToBalanceLoad 19.6ms 0.3%
UnrollPerAxisTileDMA 17.0ms 0.2%
NNDMATiling 9.4ms 0.1%
BatchMatMulToMatMul 4.3ms 0.1%
FlattenSparseWeightsTypes 4.1ms 0.1%
SegmentHalos 3.5ms 0.0%
UnrollSwKernel 3.3ms 0.0%
ComputeHaloRegionForDPUTaskOp 2.8ms 0.0%
UnrollGatherDMA 1.5ms 0.0%
UnrollShaveCacheOps 0.8ms 0.0%
ComputeSESizes 0.7ms 0.0%
AdjustInputDataForExplicitSETable 0.6ms 0.0%
UnrollDMAAnalysis 0.5ms 0.0% (A) vpux::VPUIP::UnrollDMAAnalysis 0.5ms 0.0%
MoveDeclarationsToTop 0.3ms 0.0%
func.func' Pipeline 116.7ms 1.6% OutputPipelineTiling 108.9ms 1.5%
ApplyTiling 7.8ms 0.1%
func.func' Pipeline 101.2ms 1.4% OptimizeCopies 42.9ms 0.6%
OptimizeParallelCopies 21.5ms 0.3%
OptimizeConcatViewCopies 11.0ms 0.1%
OptimizeConvertDMAOp 10.3ms 0.1%
FuseDDRCopiesIntoConcats 5.4ms 0.1%
OptimizeTileOpAsNNDMA 5.2ms 0.1%
FuseLastCopy 1.4ms 0.0% (A) vpux::AliasesInfo 1.1ms 0.0%
InsertCopyForEltwiseInPlaceInput 1.4ms 0.0% (A) vpux::AliasesInfo 1.1ms 0.0%
ConvertToDMA 1.2ms 0.0%
UniquifyWeightsTableCopies 0.3ms 0.0%
OptimizeSubviewCopies 0.2ms 0.0%
ConvertDynamicReshapeToInPlace 0.2ms 0.0%
func.func' Pipeline 93.5ms 1.3% InferenceExecutionAnalysis 93.5ms 1.3%
Canonicalizer 77.5ms 1.0%
OneShotBufferizeVPU2VPUIP 70.2ms 0.9%
func.func' Pipeline 59.2ms 0.8% TileActShaveKernelTask 54.9ms 0.7%
MovePureViewOpBeforeCopy 13.3ms 0.2%
WrapWithPermuteAsNNDMA 1.3ms 0.0%
ConvertSprLUTToConst 1.2ms 0.0%
SetZeroOffsetWeightsTable 0.7ms 0.0%
OptimizeExpandSubview 0.6ms 0.0%
ConvertExpand 0.4ms 0.0%
func.func' Pipeline 58.3ms 0.8% MakeOpsWithDistributedTensor 31.0ms 0.4% (A) vpux::VPU::SiblingOpsAnalysis 0.1ms 0.0%
RelocateWeightTableForReuse 17.8ms 0.2%
MakeDistributedCopies 4.0ms 0.1%
OptimizeConcat 2.1ms 0.0%
OptimizeSharedInputCopyForConcat 2.0ms 0.0%
AdjustDistributedTensorAroundOps 0.7ms 0.0%
AdjustMemorySpace 0.5ms 0.0%
ComputeInterpolateCoordinates 0.1ms 0.0%
RemoveOutputSparseToAvoidSuboptimalDPUWorkloadsPass 0.1ms 0.0%
Canonicalizer 37.6ms 0.5%
Canonicalizer 23.0ms 0.3%
SetMemorySpace 18.2ms 0.2% (A) vpux::AliasesInfo 5.6ms 0.1%
func.func' Pipeline 17.4ms 0.2% ConvertViewOpsToDeclarations 17.4ms 0.2% (A) vpux::AliasesInfo 2.0ms 0.0%
func.func' Pipeline 15.4ms 0.2% UngroupBoundedBuffers 8.0ms 0.1%
UngroupBufferSectionRewriterExecutor 6.7ms 0.1%
ComputeSEBasePtrs 0.4ms 0.0%
ConvertSETablesToConstants 0.2ms 0.0%
PropagateSparsityCompression 0.2ms 0.0%
Canonicalizer 13.5ms 0.2%
Canonicalizer 13.1ms 0.2%
func.func' Pipeline 10.9ms 0.1% Canonicalizer 10.9ms 0.1%
Canonicalizer 10.8ms 0.1%
Canonicalizer 10.5ms 0.1%
Canonicalizer 10.2ms 0.1%
Canonicalizer 9.0ms 0.1%
func.func' Pipeline 5.1ms 0.1% ConvertIEToVPUNCE 4.4ms 0.1%
ConvertLayers2VPU 0.6ms 0.0%
ConvertDynamicQuantToVPUNCE 0.1ms 0.0%
func.func' Pipeline 5.0ms 0.1% InputQuantizationRestoration 4.8ms 0.1%
PropagateAndCleanUpFQ 0.1ms 0.0%
ConvertVariadicSplitToStridedSlice 0.1ms 0.0%
Canonicalizer 4.8ms 0.1%
func.func' Pipeline 4.3ms 0.1% AddCopyBetweenSWKernelsAndNetworkIO 4.3ms 0.1%
func.func' Pipeline 4.0ms 0.1% ConvertEltwiseToInPlace 4.0ms 0.1% (A) vpux::AliasesInfo 3.1ms 0.0%
func.func' Pipeline 3.4ms 0.0% ConvertTransferOpsToDMAs 3.4ms 0.0%
AdjustDynamicOpsBeforeBufferization 3.0ms 0.0%
ConvertFuncArgsToDeclarations 3.0ms 0.0%
func.func' Pipeline 2.7ms 0.0% func.func' Pipeline 2.7ms 0.0% LegalizeRepeatingFuncCalls 1.5ms 0.0%
ConvWeightsCompression 0.6ms 0.0%
FuseConstants 0.6ms 0.0%
ComputeSESizes 0.2ms 0.0%
func.func' Pipeline 1.3ms 0.0% EnsureNCEOpsSizeRequirements 0.4ms 0.0%
SparsifyWeights 0.3ms 0.0%
OptimizeConcat 0.2ms 0.0%
SplitRealDFTOps 0.1ms 0.0%
func.func' Pipeline 1.2ms 0.0% ConvertShapeTo4D 0.7ms 0.0%
AdaptShapesForScaleShiftPass 0.2ms 0.0%
AdaptShapesForScaleShiftPass 0.1ms 0.0%
HandleLargeKernels 0.1ms 0.0%
BoundedTensorsToDynamicDimsMask 1.2ms 0.0%
ConvertPrecisionToFP16 1.1ms 0.0%
func.func' Pipeline 1.1ms 0.0% ConvertWeightsToU8 0.3ms 0.0%
ConvertWeightsToU8 0.2ms 0.0%
PropagateAndFuseQuantizeDequantize 0.1ms 0.0%
FuseActivationOps 0.1ms 0.0%
ConvertToMixedPrecision 0.1ms 0.0%
ConvertWeightsToI4 0.1ms 0.0%
ConvertToMixedPrecision 0.1ms 0.0%
func.func' Pipeline 1.0ms 0.0% MemPermuteProcessingPipelineRewriterExecutor 0.8ms 0.0%
ConvertMemPermuteToOpPass 0.1ms 0.0%
AddBuffersForNetResults 0.9ms 0.0%
Canonicalizer 0.8ms 0.0%
func.func' Pipeline 0.8ms 0.0% AdjustForVPUPipelineRewriterExecutor 0.3ms 0.0%
SwapOperations 0.2ms 0.0%
ConvertScatter 0.1ms 0.0%
func.func' Pipeline 0.8ms 0.0% CorrectStorageElementTableSeSizeForSEPDWConv 0.8ms 0.0%
UngroupHostBuffersAsFuncArgs 0.8ms 0.0%
func.func' Pipeline 0.7ms 0.0% PropagateAffineReshape 0.2ms 0.0%
SwapOperations 0.2ms 0.0%
UniquifySimilarOps 0.1ms 0.0%
UniquifyBranches 0.1ms 0.0%
PropagateExpand 0.1ms 0.0%
Canonicalizer 0.7ms 0.0%
QueryArgsAllocationAnalysis 0.7ms 0.0% (A) vpux::ReservedMemInfo 0.6ms 0.0% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 0.5ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 0.5ms 0.0%
(A) vpux::AllocationInfo 0.1ms 0.0%
func.func' Pipeline 0.6ms 0.0% ConvertExtractImagePatches 0.2ms 0.0%
ConvertFCToConv 0.1ms 0.0%
Canonicalizer 0.6ms 0.0%
func.func' Pipeline 0.6ms 0.0% AdjustLayouts 0.5ms 0.0%
TransposeToPermuteCast 0.1ms 0.0%
func.func' Pipeline 0.6ms 0.0% AdjustMemPermuteAroundOp 0.2ms 0.0%
ExpandActivationChannels 0.2ms 0.0%
UniquifySimilarOps 0.1ms 0.0%
AdjustConvolutionShape 0.1ms 0.0%
VerticalFusionOutlining 0.6ms 0.0%
func.func' Pipeline 0.5ms 0.0% OptimizeActivationsPipelineRewriterExecutor 0.3ms 0.0%
ConvertShapeTo4D 0.2ms 0.0%
func.func' Pipeline 0.5ms 0.0% OptimizeReorders 0.5ms 0.0%
Canonicalizer 0.5ms 0.0%
func.func' Pipeline 0.5ms 0.0% LegalizeDynamicShapeConcatForSWLayers 0.3ms 0.0%
AdjustMemorySpaceForSHVOps 0.2ms 0.0%
func.func' Pipeline 0.4ms 0.0% SwapOperations 0.2ms 0.0%
ConvertSplitConcatToAffineReshape 0.1ms 0.0%
ConvertBranchesConcatToConv 0.1ms 0.0%
func.func' Pipeline 0.4ms 0.0% ConvertToScaleShift 0.2ms 0.0%
SwapOperations 0.1ms 0.0%
func.func' Pipeline 0.4ms 0.0% PropagateAffineReshape 0.2ms 0.0%
PropagateTranspose 0.1ms 0.0%
UniquifyBranches 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% LegalizeReifyResultShapesResiduals 0.1ms 0.0%
ConvertScalarToTensor 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% OptimizeParallelLayers 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% BatchOpProcessingPipelineRewriterExecutor 0.2ms 0.0%
func.func' Pipeline 0.3ms 0.0% HandleLargeKernels 0.1ms 0.0%
HandleLargeStrides 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% PropagateMemPermuteBeforeOp 0.2ms 0.0%
LegalizeNDMemPermute 0.1ms 0.0%
func.func' Pipeline 0.3ms 0.0% OptimizeSliceExpand 0.1ms 0.0%
AdjustConvolutionWeights 0.1ms 0.0%
AdjustConvolutionInputShape 0.1ms 0.0%
AdjustInputShape 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% UniquifySimilarOps 0.1ms 0.0%
AdjustConvolutionShape 0.1ms 0.0%
AdjustInputShape 0.1ms 0.0%
Canonicalizer 0.3ms 0.0%
Canonicalizer 0.3ms 0.0%
DumpStatisticsOfIeOps 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
ConvertPrecisionToI32 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% SwapFakeQuantWithReshapeAndStridedSlice 0.1ms 0.0%
SwapConvertWithReshapeKindOps 0.1ms 0.0%
AlignScales 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% UniquifyBranches 0.1ms 0.0%
PropagateReorderToNCE 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% ConvertReorderToPermuteQuantize 0.1ms 0.0%
ConvertToMemPermute 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% MovePermutePostEltwise 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
Canonicalizer 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% PropagateAffineReshape 0.1ms 0.0%
OptimizeSliceExpand 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% AdaptODUPermutePass 0.1ms 0.0%
PropagateShapeCast 0.1ms 0.0%
PropagatePermuteCast 0.1ms 0.0%
UngroupBoundedBuffersAsFuncArgs 0.2ms 0.0%
StopLocationVerifierPass 0.1ms 0.0%
ResolveShapedTypeResultDimsPass 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% InitialLowPrecisionTransformationsPipelineRewriterExecutor 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
StopLocationVerifierPass 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% ConvertScaleShiftToDW 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
OptimizePrecisionAcrossFunctionCalls 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% PropagateMemPermuteThroughEltwise 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% OptimizeSliceExpand 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% ConvertSplitConcatToTranspose 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
CSE 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% UniquifySimilarOps 0.1ms 0.0%
CSE 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
DumpStatisticsOfIeOps 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
ELF pipeline 2474.9ms 33.4% ConvertVPUMI40XX2VPUASM 757.0ms 10.2%
func.func' Pipeline 311.6ms 4.2% ReorderMPIOps 134.5ms 1.8%
AddBootstrapWorkItems 72.4ms 1.0%
LinkEnqueueTargets 33.0ms 0.4%
AddBarrierConfigurationOps 25.4ms 0.3%
UnrollFetchTaskOps 20.6ms 0.3%
UpdateEnqueueDMAInputAndOutput 12.0ms 0.2%
NextSameIdAssignment 7.1ms 0.1%
LinkEnqueueOpsForSameBarrier 6.6ms 0.1%
func.func' Pipeline 225.6ms 3.0% ConvertVPUIP2VPUMI40XX 225.6ms 3.0%
func.func' Pipeline 176.0ms 2.4% ExpandDPUConfig 176.0ms 2.4%
func.func' Pipeline 167.5ms 2.3% ReorderMPIOps 114.4ms 1.5%
ResolveWLMTaskLocation 15.5ms 0.2%
GroupExecutionOps 11.2ms 0.2%
ConvertFetchDmasToFetchTaskOps 10.3ms 0.1%
PropagateFinalBarrier 8.7ms 0.1%
UnGroupExecutionOps 7.4ms 0.1%
ConvertVPUASM2NPUReg50XX 163.0ms 2.2%
Canonicalizer 145.0ms 2.0%
func.func' Pipeline 129.7ms 1.8% AddELFRelocations 120.3ms 1.6%
AddRelocationsForDynamicStridesDmas 9.4ms 0.1%
func.func' Pipeline 128.4ms 1.7% SetOpOffsets 83.8ms 1.1%
HandleAlignmentRequirements 44.6ms 0.6%
ConvertVPUIPDPU2NPUReg50XX 126.2ms 1.7%
Canonicalizer 60.3ms 0.8%
UpdateELFSectionFlags 49.5ms 0.7%
DeduceDynamicMappedInferenceVersion 17.5ms 0.2%
func.func' Pipeline 5.7ms 0.1% AddMappedInferenceVersionOp 5.7ms 0.1%
SetupProfilingVPUMI40XX 4.4ms 0.1%
func.func' Pipeline 2.5ms 0.0% SetEntryPoint 2.2ms 0.0%
AddELFSymbolTable 0.3ms 0.0%
HoistInputOutputs 0.2ms 0.0%
Build compilation pipeline 0.1ms 0.0%
Import network 31.4ms 0.4% Common nGraph passes 28.4ms 0.4%
Import nGraph function 0.9ms 0.0%
Validate MLIR module 0.7ms 0.0%
Add NetworkInfo Operation 0.2ms 0.0%
Rest 3.8ms 0.1%
sub-model 7 2.0s 1% Compile network 1992.0ms 99.7% IE to VPUIP pipeline 1802.4ms 90.2% func.func' Pipeline 984.7ms 49.3% SparsifyWeights 971.3ms 48.6%
OptimizeConcat 12.6ms 0.6%
EnsureNCEOpsSizeRequirements 0.7ms 0.0%
func.func' Pipeline 203.9ms 10.2% MergeVfSubgraphs 82.5ms 4.1%
MultiClusterStrategyAssignment 67.1ms 3.4%
TilingStrategyAssignment 53.3ms 2.7% (A) vpux::VPU::EagerSiblingOpsAnalysis 0.1ms 0.0%
EnsureNCEOpsSizeRequirements 0.3ms 0.0%
WrapVerticalFusionRegion 0.2ms 0.0%
OptimizeConcat 0.1ms 0.0%
ConvolutionSplitOverInputChannel 0.1ms 0.0%
MoveViewOpsToVF 0.1ms 0.0%
func.func' Pipeline 160.0ms 8.0% BarrierOptimization 34.0ms 1.7% (A) vpux::BarrierInfo 1.2ms 0.1%
SimplifySchedule 24.3ms 1.2% (A) vpux::BarrierInfo 0.6ms 0.0%
AddSwKernelInstructionPrefetch 15.8ms 0.8% (A) vpux::BarrierInfo 0.8ms 0.0%
WlmLegalizeSplitGraphToPages 14.2ms 0.7% (A) vpux::BarrierInfo 0.6ms 0.0%
AddPlaceholderFetchDMAs 13.9ms 0.7% (A) vpux::ExecutionGroupAnalysis 1.2ms 0.1%
(A) vpux::BarrierInfo 0.7ms 0.0%
WlmInsertDummyDmasInPages 12.5ms 0.6% (A) vpux::BarrierInfo 0.7ms 0.0%
FindWlmEnqueueDmasBarrier 12.3ms 0.6% (A) vpux::ExecutionGroupAnalysis 1.1ms 0.1%
(A) vpux::BarrierInfo 0.6ms 0.0%
WlmLegalizePagesForBarrierDmas 7.8ms 0.4% (A) vpux::BarrierInfo 0.7ms 0.0%
AssignPhysicalBarriers 5.2ms 0.3%
WlmSplitGraphToPages 4.5ms 0.2% (A) vpux::BarrierInfo 0.6ms 0.0%
SatisfyOneWaitBarrierPerTask 3.9ms 0.2% (A) vpux::BarrierInfo 0.6ms 0.0%
OptimizeBarriersSlotsUsage 3.8ms 0.2% (A) vpux::BarrierInfo 0.6ms 0.0%
UpdateSwKernelParams 1.9ms 0.1%
AddStartBarrier 1.6ms 0.1% (A) vpux::BarrierInfo 0.6ms 0.0%
AddFinalBarrier 1.5ms 0.1%
WlmInsertDummyBarriersInPages 1.5ms 0.1% (A) vpux::BarrierInfo 0.7ms 0.0%
DMAOutOfOrderOptimization 0.8ms 0.0%
InsertDelayDPUVariant 0.3ms 0.0%
SplitControlGraph 0.2ms 0.0%
func.func' Pipeline 108.0ms 5.4% UnrollDistributedOps 59.7ms 3.0%
SplitDMAToBalanceLoad 25.5ms 1.3%
DetectDMASplitCandidate 9.4ms 0.5%
SegmentHalos 4.6ms 0.2%
NNDMATiling 3.6ms 0.2%
ComputeHaloRegionForDPUTaskOp 2.3ms 0.1%
FlattenSparseWeightsTypes 1.2ms 0.1%
UnrollSwKernel 0.5ms 0.0%
BatchMatMulToMatMul 0.2ms 0.0%
ComputeSESizes 0.2ms 0.0%
AdjustInputDataForExplicitSETable 0.2ms 0.0%
UnrollDMAAnalysis 0.2ms 0.0% (A) vpux::VPUIP::UnrollDMAAnalysis 0.2ms 0.0%
UnrollShaveCacheOps 0.2ms 0.0%
func.func' Pipeline 80.7ms 4.0% FeasibleAllocation 67.4ms 3.4% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 1.6ms 0.1%
(A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 1.6ms 0.1%
(A) vpux::AsyncDepsInfo 0.2ms 0.0%
MoveViewOpsIntoAsyncRegions 6.0ms 0.3%
CalculateAsyncRegionCycleCost 4.8ms 0.2%
WrapIntoAsyncRegions 1.3ms 0.1%
MoveWaitResultToAsyncBlockArgs 1.2ms 0.1% (A) vpux::AsyncDepsInfo 0.5ms 0.0%
func.func' Pipeline 24.1ms 1.2% RelocateWeightTableForReuse 12.5ms 0.6%
MakeOpsWithDistributedTensor 8.3ms 0.4%
MakeDistributedCopies 1.6ms 0.1%
OptimizeSharedInputCopyForConcat 0.7ms 0.0%
OptimizeConcat 0.7ms 0.0%
AdjustDistributedTensorAroundOps 0.2ms 0.0%
AdjustMemorySpace 0.1ms 0.0%
func.func' Pipeline 22.1ms 1.1% SplitFakeQuant 11.1ms 0.6%
ProcessAsymmetricZeroPointsForMatmul 10.9ms 0.5%
Canonicalizer 21.7ms 1.1%
func.func' Pipeline 17.0ms 0.8% OptimizeCopies 8.0ms 0.4%
OptimizeConvertDMAOp 2.5ms 0.1%
OptimizeParallelCopies 1.4ms 0.1%
OptimizeConcatViewCopies 1.2ms 0.1%
FuseDDRCopiesIntoConcats 1.2ms 0.1%
OptimizeTileOpAsNNDMA 1.2ms 0.1%
FuseLastCopy 0.6ms 0.0% (A) vpux::AliasesInfo 0.5ms 0.0%
InsertCopyForEltwiseInPlaceInput 0.6ms 0.0% (A) vpux::AliasesInfo 0.5ms 0.0%
ConvertToDMA 0.2ms 0.0%
Canonicalizer 17.0ms 0.9%
func.func' Pipeline 14.1ms 0.7% SplitNCEOpsOntoWorkloads 13.1ms 0.7%
ComputeNCEInputWorkloads 0.8ms 0.0%
CorrectNCEWorkloads 0.1ms 0.0%
func.func' Pipeline 11.8ms 0.6% ConvertAsyncOpsToTasks 3.1ms 0.2%
UngroupBoundedBuffers 3.0ms 0.2%
StaticAllocation 2.9ms 0.1% (A) vpux::AllocationInfo 1.1ms 0.1% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 0.4ms 0.0%
(A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 0.3ms 0.0%
(A) vpux::AsyncDepsInfo 0.4ms 0.0%
OptimizeAsyncDeps 1.7ms 0.1% (A) vpux::AsyncDepsInfo 0.4ms 0.0%
ConvertAllocationsToDeclarations 0.5ms 0.0%
LinearizeCallOps 0.3ms 0.0% (A) vpux::AsyncDepsInfo 0.2ms 0.0%
BreakDataFlow 0.2ms 0.0%
PatchWeightsTable 0.1ms 0.0%
func.func' Pipeline 8.7ms 0.4% InferenceExecutionAnalysis 8.7ms 0.4%
OneShotBufferizeVPU2VPUIP 7.6ms 0.4%
func.func' Pipeline 7.3ms 0.4% TileActShaveKernelTask 3.3ms 0.2%
MovePureViewOpBeforeCopy 3.2ms 0.2%
ConvertSprLUTToConst 0.3ms 0.0%
WrapWithPermuteAsNNDMA 0.2ms 0.0%
SetZeroOffsetWeightsTable 0.1ms 0.0%
OptimizeExpandSubview 0.1ms 0.0%
ConvertExpand 0.1ms 0.0%
func.func' Pipeline 5.9ms 0.3% ApplyTiling 4.6ms 0.2%
OutputPipelineTiling 1.3ms 0.1%
func.func' Pipeline 5.6ms 0.3% ConvertToMixedPrecision 2.0ms 0.1%
ConvertWeightsToI8 1.9ms 0.1%
PropagateAndFuseQuantizeDequantize 1.0ms 0.1%
ConvertWeightsToU8 0.2ms 0.0%
ConvertWeightsToU8 0.1ms 0.0%
FuseActivationOps 0.1ms 0.0%
ConvertToPalletizationLUT 0.1ms 0.0%
Canonicalizer 5.2ms 0.3%
func.func' Pipeline 3.8ms 0.2% InitialLowPrecisionTransformationsPipelineRewriterExecutor 3.8ms 0.2%
func.func' Pipeline 3.7ms 0.2% UngroupBoundedBuffers 1.9ms 0.1%
UngroupBufferSectionRewriterExecutor 1.6ms 0.1%
func.func' Pipeline 3.6ms 0.2% Canonicalizer 3.5ms 0.2%
func.func' Pipeline 2.9ms 0.1% ConvertViewOpsToDeclarations 2.9ms 0.1% (A) vpux::AliasesInfo 0.5ms 0.0%
func.func' Pipeline 2.6ms 0.1% ConvertIEToVPUNCE 2.4ms 0.1%
ConvertLayers2VPU 0.2ms 0.0%
QueryArgsAllocationAnalysis 2.6ms 0.1% (A) vpux::ReservedMemInfo 2.6ms 0.1% (A) vpux::AllocationInfo 1.1ms 0.1% (A) vpux::AsyncDepsInfo 0.7ms 0.0%
(A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 0.7ms 0.0% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 0.4ms 0.0%
Canonicalizer 1.6ms 0.1%
Canonicalizer 1.6ms 0.1%
Canonicalizer 1.5ms 0.1%
func.func' Pipeline 1.5ms 0.1% Canonicalizer 1.3ms 0.1%
Canonicalizer 1.3ms 0.1%
AddCopyBetweenSWKernelsAndNetworkIO 1.1ms 0.1%
Canonicalizer 1.0ms 0.1%
func.func' Pipeline 1.0ms 0.0% ConvertTransferOpsToDMAs 1.0ms 0.0%
func.func' Pipeline 0.9ms 0.0% ConvertEltwiseToInPlace 0.9ms 0.0% (A) vpux::AliasesInfo 0.8ms 0.0%
SetMemorySpace 0.9ms 0.0% (A) vpux::AliasesInfo 0.5ms 0.0%
Canonicalizer 0.8ms 0.0%
Canonicalizer 0.7ms 0.0%
func.func' Pipeline 0.7ms 0.0% LegalizeRepeatingFuncCalls 0.5ms 0.0%
ConvWeightsCompression 0.1ms 0.0%
FuseConstants 0.1ms 0.0%
DispatchedInliner 0.6ms 0.0%
func.func' Pipeline 0.4ms 0.0% ConvertShapeTo4D 0.3ms 0.0%
func.func' Pipeline 0.4ms 0.0% CorrectStorageElementTableSeSizeForSEPDWConv 0.3ms 0.0%
func.func' Pipeline 0.3ms 0.0% ConvertShapeTo4D 0.2ms 0.0%
OptimizeActivationsPipelineRewriterExecutor 0.1ms 0.0%
AdjustDynamicOpsBeforeBufferization 0.3ms 0.0%
ConvertPrecisionToFP16 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% AdjustForVPUPipelineRewriterExecutor 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% PropagateAffineReshape 0.1ms 0.0%
func.func' Pipeline 0.2ms 0.0% PropagateAffineReshape 0.1ms 0.0%
BoundedTensorsToDynamicDimsMask 0.2ms 0.0%
func.func' Pipeline 0.1ms 0.0% InputQuantizationRestoration 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% ConvertScalarToTensor 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% func.func' Pipeline 0.1ms 0.0% OptimizeReorders 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% AdjustMemPermuteAroundOp 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% MemPermuteProcessingPipelineRewriterExecutor 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% PropagateAffineReshape 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
DumpStatisticsOfIeOps 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
VerticalFusionOutlining 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
Canonicalizer 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0%
UngroupHostBuffersAsFuncArgs 0.1ms 0.0%
AddBuffersForNetResults 0.1ms 0.0%
ConvertFuncArgsToDeclarations 0.1ms 0.0%
ELF pipeline 189.6ms 9.5% ConvertVPUMI40XX2VPUASM 57.3ms 2.9%
func.func' Pipeline 19.9ms 1.0% ConvertVPUIP2VPUMI40XX 19.9ms 1.0%
func.func' Pipeline 17.3ms 0.9% ExpandDPUConfig 17.3ms 0.9%
func.func' Pipeline 15.8ms 0.8% SetOpOffsets 10.3ms 0.5%
HandleAlignmentRequirements 5.4ms 0.3%
ConvertVPUASM2NPUReg50XX 15.5ms 0.8%
func.func' Pipeline 13.8ms 0.7% ReorderMPIOps 5.6ms 0.3%
AddBootstrapWorkItems 3.0ms 0.1%
LinkEnqueueTargets 2.2ms 0.1%
UnrollFetchTaskOps 1.0ms 0.1%
AddBarrierConfigurationOps 1.0ms 0.0%
NextSameIdAssignment 0.4ms 0.0%
UpdateEnqueueDMAInputAndOutput 0.4ms 0.0%
LinkEnqueueOpsForSameBarrier 0.2ms 0.0%
ConvertVPUIPDPU2NPUReg50XX 9.8ms 0.5%
Canonicalizer 9.2ms 0.5%
func.func' Pipeline 8.7ms 0.4% AddELFRelocations 8.3ms 0.4%
AddRelocationsForDynamicStridesDmas 0.4ms 0.0%
func.func' Pipeline 7.5ms 0.4% ReorderMPIOps 5.0ms 0.3%
ResolveWLMTaskLocation 1.1ms 0.1%
GroupExecutionOps 0.4ms 0.0%
ConvertFetchDmasToFetchTaskOps 0.4ms 0.0%
PropagateFinalBarrier 0.3ms 0.0%
UnGroupExecutionOps 0.2ms 0.0%
UpdateELFSectionFlags 5.8ms 0.3%
Canonicalizer 4.6ms 0.2%
DeduceDynamicMappedInferenceVersion 1.4ms 0.1%
func.func' Pipeline 0.4ms 0.0% AddELFSymbolTable 0.2ms 0.0%
SetEntryPoint 0.1ms 0.0%
SetupProfilingVPUMI40XX 0.2ms 0.0%
func.func' Pipeline 0.2ms 0.0% AddMappedInferenceVersionOp 0.2ms 0.0%
Build compilation pipeline 0.1ms 0.0%
Import network 5.6ms 0.3% Common nGraph passes 4.3ms 0.2%
Validate MLIR module 0.3ms 0.0%
Import nGraph function 0.1ms 0.0%
Rest 0.3ms 0.0%
Read it top-down: the compiler splits a compile into IE to VPUIP pipeline
(the optimizer + memory scheduler, ~81%) and ELF pipeline (the backend that emits the blob,
~19%). Expand IE to VPUIP pipeline on the biggest sub-model and the top row is
FeasibleAllocation — the memory allocation/scheduling pass — at ~73s summed. That single pass is
what makes large-model compiles explode.
3 · Same tree, a vision model — size, not modality
The identical report for a vision transformer (ViT-large) has the same shape and the same heaviest pass —
so the bottleneck is set by model scale, not whether it is vision or language.
ViT-large/384 · int8 1 report · same tree shape as the LLM expand all
Compile network 20212.5ms 99.1% IE to VPUIP pipeline 14904.4ms 73.1% func.func' Pipeline 5050.5ms 24.8% SimplifySchedule 684.4ms 3.4% (A) vpux::BarrierInfo 30.7ms 0.2%
BarrierOptimization 656.7ms 3.2% (A) vpux::BarrierInfo 29.2ms 0.1%
FindWlmEnqueueDmasBarrier 528.9ms 2.6% (A) vpux::ExecutionGroupAnalysis 57.7ms 0.3%
(A) vpux::BarrierInfo 28.9ms 0.1%
AddPlaceholderFetchDMAs 511.9ms 2.5% (A) vpux::ExecutionGroupAnalysis 48.3ms 0.2%
(A) vpux::BarrierInfo 28.1ms 0.1%
WlmInsertDummyDmasInPages 466.6ms 2.3% (A) vpux::BarrierInfo 30.1ms 0.1%
WlmLegalizeSplitGraphToPages 451.7ms 2.2% (A) vpux::BarrierInfo 28.6ms 0.1%
AddSwKernelInstructionPrefetch 333.6ms 1.6% (A) vpux::BarrierInfo 24.3ms 0.1%
WlmLegalizePagesForBarrierDmas 285.6ms 1.4% (A) vpux::BarrierInfo 31.1ms 0.2%
SatisfyOneWaitBarrierPerTask 201.3ms 1.0% (A) vpux::BarrierInfo 26.6ms 0.1%
SplitControlGraph 195.5ms 1.0% (A) vpux::BarrierInfo 26.7ms 0.1%
WlmSplitGraphToPages 165.4ms 0.8% (A) vpux::BarrierInfo 26.7ms 0.1%
AssignPhysicalBarriers 155.6ms 0.8%
OptimizeBarriersSlotsUsage 135.6ms 0.7% (A) vpux::BarrierInfo 29.7ms 0.1%
AddFinalBarrier 68.7ms 0.3%
AddStartBarrier 61.4ms 0.3% (A) vpux::BarrierInfo 27.2ms 0.1%
WlmInsertDummyBarriersInPages 58.0ms 0.3% (A) vpux::BarrierInfo 30.3ms 0.1%
UpdateSwKernelParams 46.1ms 0.2%
DMAOutOfOrderOptimization 21.9ms 0.1%
InsertDelayDPUVariant 21.5ms 0.1%
func.func' Pipeline 2571.5ms 12.6% MultiClusterStrategyAssignment 1294.4ms 6.3%
ConvolutionSplitOverInputChannel 1036.1ms 5.1%
MergeVfSubgraphs 145.4ms 0.7%
TilingStrategyAssignment 87.7ms 0.4% (A) vpux::VPU::EagerSiblingOpsAnalysis 0.3ms 0.0%
MoveViewOpsToVF 3.1ms 0.0%
WrapVerticalFusionRegion 2.1ms 0.0%
OptimizeConcat 1.2ms 0.0%
EnsureNCEOpsSizeRequirements 0.4ms 0.0%
DecomposeMVN 0.3ms 0.0%
EfficientIROrder 0.3ms 0.0%
UnrollUnusedVerticalFusionRegion 0.2ms 0.0%
SplitGRUSequence 0.1ms 0.0%
ApplyTilingMVN1Sum 0.1ms 0.0%
func.func' Pipeline 2242.1ms 11.0% FeasibleAllocation 2047.0ms 10.0% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 29.5ms 0.1%
(A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::CMX_NN> 19.3ms 0.1%
(A) vpux::AsyncDepsInfo 5.8ms 0.0%
MoveViewOpsIntoAsyncRegions 123.7ms 0.6%
CalculateAsyncRegionCycleCost 31.6ms 0.2%
MoveWaitResultToAsyncBlockArgs 21.7ms 0.1% (A) vpux::AsyncDepsInfo 9.7ms 0.0%
WrapIntoAsyncRegions 16.7ms 0.1%
MoveDeclarationsToTop 1.3ms 0.0%
func.func' Pipeline 1150.4ms 5.6% UnrollExpandDMA 358.0ms 1.8%
UnrollDistributedOps 324.4ms 1.6%
DetectDMASplitCandidate 120.9ms 0.6%
SplitDMAToBalanceLoad 109.9ms 0.5%
NNDMATiling 72.4ms 0.4%
FlattenSparseWeightsTypes 61.2ms 0.3%
UnrollSwKernel 18.1ms 0.1%
BatchMatMulToMatMul 13.5ms 0.1%
SegmentHalos 13.3ms 0.1%
ComputeSESizes 12.5ms 0.1%
ComputeHaloRegionForDPUTaskOp 12.1ms 0.1%
AdjustInputDataForExplicitSETable 11.3ms 0.1%
UnrollDMAAnalysis 10.8ms 0.1% (A) vpux::VPUIP::UnrollDMAAnalysis 10.8ms 0.1%
UnrollShaveCacheOps 9.6ms 0.0%
MoveDeclarationsToTop 2.4ms 0.0%
func.func' Pipeline 414.1ms 2.0% StaticAllocation 181.0ms 0.9% (A) vpux::AllocationInfo 46.0ms 0.2% (A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 15.5ms 0.1%
(A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 12.0ms 0.1%
(A) vpux::AsyncDepsInfo 8.0ms 0.0%
UngroupBoundedBuffers 71.9ms 0.4%
ConvertAsyncOpsToTasks 63.4ms 0.3%
OptimizeAsyncDeps 34.8ms 0.2% (A) vpux::AsyncDepsInfo 8.8ms 0.0%
PatchWeightsTable 23.0ms 0.1%
ConvertAllocationsToDeclarations 15.1ms 0.1%
LinearizeCallOps 12.9ms 0.1% (A) vpux::AsyncDepsInfo 8.9ms 0.0%
BreakDataFlow 7.9ms 0.0%
AddSwKernelCacheHandlingOps 4.0ms 0.0%
func.func' Pipeline 408.8ms 2.0% SparsifyWeights 406.7ms 2.0%
OptimizeConcat 0.5ms 0.0%
EnsureNCEOpsSizeRequirements 0.3ms 0.0%
RecomputeSparsityPtrs 0.3ms 0.0%
MoveConvertAroundViewLikeOps 0.1ms 0.0%
DetectionOutputDecomposition 0.1ms 0.0%
SplitRealDFTOps 0.1ms 0.0%
LowerOpsToSENCE 0.1ms 0.0%
OptimizeSparsifyDesparsifyPairs 0.1ms 0.0%
OptimizeSparsityOps 0.1ms 0.0%
Canonicalizer 404.2ms 2.0%
func.func' Pipeline 371.3ms 1.8% OptimizeCopies 157.8ms 0.8%
OptimizeConcatViewCopies 49.8ms 0.2%
OptimizeParallelCopies 48.2ms 0.2%
OptimizeConvertDMAOp 45.2ms 0.2%
OptimizeTileOpAsNNDMA 23.4ms 0.1%
FuseDDRCopiesIntoConcats 22.6ms 0.1%
InsertCopyForEltwiseInPlaceInput 10.3ms 0.1% (A) vpux::AliasesInfo 7.7ms 0.0%
FuseLastCopy 8.6ms 0.0% (A) vpux::AliasesInfo 7.4ms 0.0%
ConvertToDMA 3.0ms 0.0%
OptimizeSubviewCopies 1.0ms 0.0%
ConvertDynamicReshapeToInPlace 0.8ms 0.0%
UniquifyWeightsTableCopies 0.7ms 0.0%
func.func' Pipeline 344.3ms 1.7% OutputPipelineTiling 306.1ms 1.5%
ApplyTiling 38.2ms 0.2%
func.func' Pipeline 260.2ms 1.3% MakeOpsWithDistributedTensor 225.1ms 1.1%
MakeDistributedCopies 13.0ms 0.1%
OptimizeSharedInputCopyForConcat 7.4ms 0.0%
OptimizeConcat 7.4ms 0.0%
AdjustDistributedTensorAroundOps 5.0ms 0.0%
AdjustMemorySpace 1.4ms 0.0%
ComputeInterpolateCoordinates 0.7ms 0.0%
RemoveOutputSparseToAvoidSuboptimalDPUWorkloadsPass 0.2ms 0.0%
func.func' Pipeline 205.6ms 1.0% SplitNCEOpsOntoWorkloads 185.9ms 0.9%
ComputeNCEInputWorkloads 9.5ms 0.0%
ShiftOutputWorkloadsForHalo 7.4ms 0.0%
CorrectNCEWorkloads 2.0ms 0.0%
MoveTensorOpsToCMX 0.5ms 0.0%
MoveReflectPadToCMX 0.2ms 0.0%
func.func' Pipeline 136.0ms 0.7% TileActShaveKernelTask 63.7ms 0.3%
MovePureViewOpBeforeCopy 52.7ms 0.3%
ConvertSprLUTToConst 8.7ms 0.0%
WrapWithPermuteAsNNDMA 4.1ms 0.0%
ConvertExpand 2.7ms 0.0%
SetZeroOffsetWeightsTable 2.2ms 0.0%
OptimizeExpandSubview 1.9ms 0.0%
func.func' Pipeline 130.7ms 0.6% InferenceExecutionAnalysis 130.7ms 0.6%
Canonicalizer 120.6ms 0.6%
func.func' Pipeline 90.4ms 0.4% FuseConstants 73.6ms 0.4%
LegalizeRepeatingFuncCalls 15.1ms 0.1%
ConvWeightsCompression 1.0ms 0.0%
ComputeSESizes 0.8ms 0.0%
func.func' Pipeline 85.3ms 0.4% UngroupBufferSectionRewriterExecutor 48.8ms 0.2%
UngroupBoundedBuffers 33.1ms 0.2%
ComputeSEBasePtrs 1.6ms 0.0%
ConvertSETablesToConstants 1.0ms 0.0%
PropagateSparsityCompression 0.8ms 0.0%
QueryArgsAllocationAnalysis 77.4ms 0.4% (A) vpux::ReservedMemInfo 77.4ms 0.4% (A) vpux::AllocationInfo 33.9ms 0.2% (A) vpux::AsyncDepsInfo 14.3ms 0.1%
(A) vpux::MemLiveRangeInfoMemType<vpux::VPU::MemoryKind::DDR> 30.2ms 0.1% (A) vpux::AliasesInfoMemType<vpux::VPU::MemoryKind::DDR> 13.4ms 0.1%
OneShotBufferizeVPU2VPUIP 72.5ms 0.4%
Canonicalizer 64.5ms 0.3%
func.func' Pipeline 61.0ms 0.3% ConvertViewOpsToDeclarations 61.0ms 0.3% (A) vpux::AliasesInfo 10.0ms 0.0%
Canonicalizer 52.4ms 0.3%
Canonicalizer 51.4ms 0.3%
func.func' Pipeline 39.4ms 0.2% ConvertIEToVPUNCE 34.6ms 0.2%
ConvertLayers2VPU 4.3ms 0.0%
ConvertDynamicQuantToVPUNCE 0.5ms 0.0%
SetMemorySpace 35.7ms 0.2% (A) vpux::AliasesInfo 12.2ms 0.1%
Canonicalizer 27.9ms 0.1%
func.func' Pipeline 27.4ms 0.1% Canonicalizer 24.6ms 0.1%
func.func' Pipeline 23.0ms 0.1% ConvertEltwiseToInPlace 23.0ms 0.1% (A) vpux::AliasesInfo 18.0ms 0.1%
Canonicalizer 22.4ms 0.1%
AddCopyBetweenSWKernelsAndNetworkIO 21.2ms 0.1%
func.func' Pipeline 19.5ms 0.1% SplitFakeQuant 13.6ms 0.1%
ProcessAsymmetricZeroPointsForMatmul 4.4ms 0.0%
AlignScales 0.7ms 0.0%
SwapFakeQuantWithReshapeAndStridedSlice 0.4ms 0.0%
SwapConvertWithReshapeKindOps 0.4ms 0.0%
func.func' Pipeline 16.2ms 0.1% ConvertTransferOpsToDMAs 16.2ms 0.1%
Canonicalizer 15.7ms 0.1%
DispatchedInliner 15.6ms 0.1%
func.func' Pipeline 14.7ms 0.1% InitialLowPrecisionTransformationsPipelineRewriterExecutor 14.5ms 0.1%
func.func' Pipeline 12.3ms 0.1% ConvertShapeTo4D 3.8ms 0.0%
HandleLargeKernels 3.2ms 0.0%
AdaptShapesForScaleShiftPass 2.1ms 0.0%
AdaptShapesForScaleShiftPass 2.0ms 0.0%
HandleExcludePadForAvgPool 0.8ms 0.0%
ConvertNceOpsTo4D 0.1ms 0.0%
ConvertDivideToMultiply 0.1ms 0.0%
Canonicalizer 11.3ms 0.1%
func.func' Pipeline 8.6ms 0.0% ConvertPrecisionToFP16 8.1ms 0.0%
Canonicalizer 7.8ms 0.0%
ConvertFuncArgsToDeclarations 7.1ms 0.0%
func.func' Pipeline 6.6ms 0.0% ConvertExtractImagePatches 2.1ms 0.0%
ConvertFCToConv 1.1ms 0.0%
ConvertGather 1.0ms 0.0%
MergeParallelFullyConnected 0.5ms 0.0%
SwapOperationWithGather 0.5ms 0.0%
ConvertReduceToPooling 0.5ms 0.0%
UnrollGroupQuantize 0.4ms 0.0%
MergeFullyConnected 0.4ms 0.0%
Canonicalizer 5.5ms 0.0%
func.func' Pipeline 5.3ms 0.0% SwapOperations 4.6ms 0.0%
ConvertSplitConcatToAffineReshape 0.6ms 0.0%
func.func' Pipeline 5.2ms 0.0% ConvertWeightsToU8 0.9ms 0.0%
ConvertToMixedPrecision 0.9ms 0.0%
ConvertWeightsToU8 0.9ms 0.0%
PropagateAndFuseQuantizeDequantize 0.8ms 0.0%
ConvertToMixedPrecision 0.5ms 0.0%
FuseActivationOps 0.4ms 0.0%
ConvertWeightsToI8 0.2ms 0.0%
ConvertWeightsToI4 0.2ms 0.0%
ConvertWeightsToI8 0.2ms 0.0%
ConvertToPalletizationLUT 0.1ms 0.0%
func.func' Pipeline 4.8ms 0.0% ConvertMemPermuteToOpPass 2.9ms 0.0%
MemPermuteProcessingPipelineRewriterExecutor 1.9ms 0.0%
func.func' Pipeline 4.5ms 0.0% AdjustForVPUPipelineRewriterExecutor 1.8ms 0.0%
SwapOperations 1.4ms 0.0%
ConvertScatter 0.4ms 0.0%
ConvertPadToConcat 0.4ms 0.0%
LegalizeDilatedConvolution 0.1ms 0.0%
ConvertBroadcastToTile 0.1ms 0.0%
func.func' Pipeline 4.2ms 0.0% AdjustConvolutionInputShape 1.5ms 0.0%
AdjustInputShape 1.5ms 0.0%
OptimizeSliceExpand 0.9ms 0.0%
AdjustConvolutionWeights 0.3ms 0.0%
func.func' Pipeline 3.8ms 0.0% CorrectStorageElementTableSeSizeForSEPDWConv 3.7ms 0.0%
UnrollFlashSDPA 0.1ms 0.0%
func.func' Pipeline 3.5ms 0.0% AdjustLayouts 2.6ms 0.0%
TransposeToPermuteCast 0.8ms 0.0%
func.func' Pipeline 3.3ms 0.0% OptimizeActivationsPipelineRewriterExecutor 2.4ms 0.0%
ConvertShapeTo4D 0.3ms 0.0%
SwapViewOpAndClamp 0.3ms 0.0%
SwapConvertWithSWOp 0.3ms 0.0%
func.func' Pipeline 3.2ms 0.0% SwapOperations 1.2ms 0.0%
PropagateAffineReshape 0.6ms 0.0%
UniquifySimilarOps 0.4ms 0.0%
UniquifyBranches 0.4ms 0.0%
PropagateExpand 0.4ms 0.0%
HandleEltwiseWithSmallHeight 0.1ms 0.0%
AdjustDynamicOpsBeforeBufferization 3.0ms 0.0%
func.func' Pipeline 2.9ms 0.0% InputQuantizationRestoration 1.8ms 0.0%
PropagateAndCleanUpFQ 1.0ms 0.0%
ConvertVariadicSplitToStridedSlice 0.1ms 0.0%
func.func' Pipeline 2.9ms 0.0% ExpandActivationChannels 1.3ms 0.0%
AdjustConvolutionShape 0.7ms 0.0%
AdjustMemPermuteAroundOp 0.6ms 0.0%
UniquifySimilarOps 0.3ms 0.0%
func.func' Pipeline 2.8ms 0.0% HandleLargeKernels 1.0ms 0.0%
HandleLargeStrides 0.9ms 0.0%
ConvertStridedSlice2Conv 0.4ms 0.0%
SplitConvWithMultipleFQ 0.4ms 0.0%
HandleLargePads 0.1ms 0.0%
func.func' Pipeline 2.7ms 0.0% SwapOperations 1.4ms 0.0%
ConvertToScaleShift 1.1ms 0.0%
FuseScale 0.1ms 0.0%
ConvertGRNToNormalizeL2 0.1ms 0.0%
func.func' Pipeline 2.7ms 0.0% OptimizeReorders 2.7ms 0.0%
Canonicalizer 2.5ms 0.0%
func.func' Pipeline 2.4ms 0.0% OptimizeParallelLayers 1.0ms 0.0%
AdjustFakeQdqParams 0.5ms 0.0%
DecomposeLSTMSequence 0.5ms 0.0%
DecomposeISTFT 0.1ms 0.0%
HandleU16FakeQuantize 0.1ms 0.0%
DecomposeGRUCell 0.1ms 0.0%
FuseAttention 0.1ms 0.0%
VerticalFusionOutlining 2.4ms 0.0%
func.func' Pipeline 2.2ms 0.0% AdjustConvolutionShape 0.9ms 0.0%
UniquifySimilarOps 0.5ms 0.0%
AdjustInputShape 0.5ms 0.0%
AlignDimensionsForDPU 0.2ms 0.0%
OptimizeOpSlice 0.1ms 0.0%
OptimizeSliceWithStride 0.1ms 0.0%
UngroupHostBuffersAsFuncArgs 2.2ms 0.0%
AddBuffersForNetResults 2.2ms 0.0%
Canonicalizer 2.1ms 0.0%
Canonicalizer 2.1ms 0.0%
BoundedTensorsToDynamicDimsMask 1.9ms 0.0%
func.func' Pipeline 1.8ms 0.0% AdaptODUPermutePass 0.5ms 0.0%
PropagateShapeCast 0.5ms 0.0%
PropagatePermuteCast 0.5ms 0.0%
ConvertExpandToConvPass 0.2ms 0.0%
OptimizeIdentityPool 0.1ms 0.0%
Canonicalizer 1.7ms 0.0%
func.func' Pipeline 1.7ms 0.0% LegalizeReifyResultShapesResiduals 0.5ms 0.0%
ReshapeMatMulInputs 0.5ms 0.0%
DynamicConcatToScatterNDUpdate 0.4ms 0.0%
ConvertScalarToTensor 0.3ms 0.0%
Canonicalizer 1.7ms 0.0%
Canonicalizer 1.7ms 0.0%
func.func' Pipeline 1.7ms 0.0% ConvertBatchedLayerTo1N 1.1ms 0.0%
UpstreamSlice 0.4ms 0.0%
ConvertBroadcastToTile 0.1ms 0.0%
UnrollBatch 0.1ms 0.0%
Canonicalizer 1.6ms 0.0%
Canonicalizer 1.6ms 0.0%
func.func' Pipeline 1.6ms 0.0% OptimizeSliceExpand 1.0ms 0.0%
PropagateAffineReshape 0.6ms 0.0%
Canonicalizer 1.5ms 0.0%
Canonicalizer 1.4ms 0.0%
Canonicalizer 1.4ms 0.0%
func.func' Pipeline 1.4ms 0.0% PropagateAffineReshape 0.8ms 0.0%
PropagateTranspose 0.3ms 0.0%
UniquifyBranches 0.3ms 0.0%
Canonicalizer 1.4ms 0.0%
Canonicalizer 1.3ms 0.0%
func.func' Pipeline 1.3ms 0.0% ConvertToMemPermute 0.9ms 0.0%
ConvertReorderToPermuteQuantize 0.3ms 0.0%
Canonicalizer 1.2ms 0.0%
Canonicalizer 1.2ms 0.0%
Canonicalizer 1.1ms 0.0%
Canonicalizer 1.1ms 0.0%
func.func' Pipeline 1.0ms 0.0% UniquifyBranches 0.5ms 0.0%
PropagateReorderToNCE 0.4ms 0.0%
FuseReordersPass 0.1ms 0.0%
func.func' Pipeline 1.0ms 0.0% OptimizeSliceExpand 1.0ms 0.0%
func.func' Pipeline 1.0ms 0.0% DetectInPlaceEltwise 0.4ms 0.0%
AutopadChannels 0.3ms 0.0%
LowerSparsityOps 0.2ms 0.0%
func.func' Pipeline 0.9ms 0.0% BatchOpProcessingPipelineRewriterExecutor 0.5ms 0.0%
DecomposeSTFT 0.1ms 0.0%
Canonicalizer 0.9ms 0.0%
func.func' Pipeline 0.9ms 0.0% LegalizeDynamicShapeConcatForSWLayers 0.4ms 0.0%
AdjustMemorySpaceForSHVOps 0.4ms 0.0%
func.func' Pipeline 0.7ms 0.0% PropagateMemPermuteBeforeOp 0.4ms 0.0%
LegalizeNDMemPermute 0.3ms 0.0%
CSE 0.7ms 0.0%
CSE 0.7ms 0.0%
Canonicalizer 0.7ms 0.0%
func.func' Pipeline 0.7ms 0.0% UngroupBoundedBuffersAsFuncArgs 0.7ms 0.0%
CSE 0.6ms 0.0%
Canonicalizer 0.6ms 0.0%
CSE 0.6ms 0.0%
Canonicalizer 0.6ms 0.0%
CSE 0.6ms 0.0%
CSE 0.6ms 0.0%
Canonicalizer 0.6ms 0.0%
Canonicalizer 0.6ms 0.0%
Canonicalizer 0.6ms 0.0%
func.func' Pipeline 0.6ms 0.0% UniquifySimilarOps 0.4ms 0.0%
RemoveViewLikeOpsChainPass 0.1ms 0.0%
Canonicalizer 0.6ms 0.0%
Canonicalizer 0.6ms 0.0%
Canonicalizer 0.6ms 0.0%
DumpStatisticsOfIeOps 0.5ms 0.0%
StopLocationVerifierPass 0.5ms 0.0%
ResolveShapedTypeResultDimsPass 0.5ms 0.0%
CSE 0.5ms 0.0%
Canonicalizer 0.5ms 0.0%
Canonicalizer 0.5ms 0.0%
Canonicalizer 0.5ms 0.0%
Canonicalizer 0.5ms 0.0%
Canonicalizer 0.5ms 0.0%
ConvertPrecisionToI32 0.4ms 0.0%
func.func' Pipeline 0.4ms 0.0% ConvertScaleShiftToDW 0.3ms 0.0%
ConvertBroadcastToTile 0.1ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
Canonicalizer 0.4ms 0.0%
func.func' Pipeline 0.4ms 0.0% MovePermutePostEltwise 0.3ms 0.0%
func.func' Pipeline 0.4ms 0.0% PropagateMemPermuteThroughEltwise 0.4ms 0.0%
CSE 0.4ms 0.0%
func.func' Pipeline 0.4ms 0.0% ConvertSplitConcatToTranspose 0.4ms 0.0%
StopLocationVerifierPass 0.3ms 0.0%
OptimizePrecisionAcrossFunctionCalls 0.3ms 0.0%
OutlineEntireMainContent 0.3ms 0.0%
func.func' Pipeline 0.2ms 0.0% ConvertMVN6ToMVN1 0.2ms 0.0%
DumpStatisticsOfIeOps 0.2ms 0.0%
InitResources 0.1ms 0.0%
SetupNpuConstraint 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% PopulateDynamicDimensionsHW 0.1ms 0.0%
AdjustSoftwareOpsPrecision 0.1ms 0.0%
AdjustNCEOpsWithI32Inputs 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% ConvertAssignReadValueToReturnsAndInputs 0.1ms 0.0%
func.func' Pipeline 0.1ms 0.0% HandleExcludePadForAvgPool 0.1ms 0.0%
ELF pipeline 5308.1ms 26.0% ConvertVPUMI40XX2VPUASM 1452.9ms 7.1%
func.func' Pipeline 893.6ms 4.4% ReorderMPIOps 375.1ms 1.8%
AddBootstrapWorkItems 253.4ms 1.2%
AddBarrierConfigurationOps 76.5ms 0.4%
LinkEnqueueTargets 73.0ms 0.4%
UnrollFetchTaskOps 54.5ms 0.3%
UpdateEnqueueDMAInputAndOutput 25.7ms 0.1%
NextSameIdAssignment 19.5ms 0.1%
LinkEnqueueOpsForSameBarrier 15.9ms 0.1%
func.func' Pipeline 471.5ms 2.3% ReorderMPIOps 338.4ms 1.7%
ResolveWLMTaskLocation 37.4ms 0.2%
ConvertFetchDmasToFetchTaskOps 27.1ms 0.1%
PropagateFinalBarrier 26.4ms 0.1%
GroupExecutionOps 25.3ms 0.1%
UnGroupExecutionOps 16.9ms 0.1%
func.func' Pipeline 455.9ms 2.2% ConvertVPUIP2VPUMI40XX 455.9ms 2.2%
func.func' Pipeline 379.0ms 1.9% ExpandDPUConfig 379.0ms 1.9%
Canonicalizer 354.5ms 1.7%
ConvertVPUASM2NPUReg50XX 314.7ms 1.5%
ConvertVPUIPDPU2NPUReg50XX 264.9ms 1.3%
func.func' Pipeline 245.3ms 1.2% SetOpOffsets 152.1ms 0.7%
HandleAlignmentRequirements 93.2ms 0.5%
func.func' Pipeline 165.9ms 0.8% AddELFRelocations 146.8ms 0.7%
AddRelocationsForDynamicStridesDmas 19.1ms 0.1%
Canonicalizer 145.7ms 0.7%
UpdateELFSectionFlags 98.3ms 0.5%
DeduceDynamicMappedInferenceVersion 27.6ms 0.1%
func.func' Pipeline 16.6ms 0.1% AddMappedInferenceVersionOp 16.6ms 0.1%
SetupProfilingVPUMI40XX 12.1ms 0.1%
func.func' Pipeline 5.3ms 0.0% SetEntryPoint 3.5ms 0.0%
AddELFSymbolTable 1.8ms 0.0%
Build compilation pipeline 0.1ms 0.0%
HoistInputOutputs 0.1ms 0.0%
Import network 160.1ms 0.8% Common nGraph passes 141.3ms 0.7%
Import nGraph function 14.9ms 0.1%
Validate MLIR module 2.7ms 0.0%
Add NetworkInfo Operation 0.1ms 0.0%
Rest 20.6ms 0.1%
Method & reproducibility
The installed compiler prints this per-pass tree at LOG_INFO when
OV_NPU_LOG_FILTER=vpux-compiler is set before import openvino; the harness captures
the native stderr (fd-level) and reconstructs the tree from the report's indentation — the nodes and numbers
are the compiler's, unmodified (passes below 0.05 ms are elided for size). Cold =
NPU_BYPASS_UMD_CACHING=YES; warm = an OpenVINO CACHE_DIR. Env
/data/envs/openvino-3.12 (OpenVINO 2026.0.0), NPU driver-compiler 1.33. The tree structure comes
from the compiler's pass pipeline (src/vpux_compiler/src/NPU50XX/dialect_pipeline_strategy.cpp in
openvinotoolkit/npu_compiler). Code: experiments/npu_compile/ in the edge-ai repo
(stages.py::parse_timing_tree · make_page.py). Run folders are write-once.