sense-voice-encoder.onnx
Format: LLM-SCAN  ·  Size: 893.8 MB  ·  Scanned: 2026-07-09  ·  10925 ms
SHA256: b1145eb7e9d2dbb9005fc99ed0313efebfadffea…

Security grade

A
Score: 94/100
2 LOW 5 INFO
Artifact Security
A / 94
Repository Trust
N/A
local upload
Deployment Confidence
Medium
Artifact Security grades the file. Repository Trust is unavailable for local uploads — no external provenance to verify. Deployment Confidence reflects artifact grade only.
Score breakdown
Base score 100
LOW No license field in ONNX model metadata -3
LOW No provenance metadata in ONNX model -3
Penalty subtotal 94/100
Final A / 94
ONNX audio-speech model | opset 17 | 7496 nodes | 233,990,207 params | 2 warnings / 5 informational

Runtime compatibility

Runtime Status Quant Architecture Context
ONNX Runtime
Direct
? opset 17 (requires ORT ≥ 1.14)
TensorRT
Verify arch support
Via conversion
verify required
? ?
verify
opset 17
OpenVINO
Verify arch support
Via conversion
verify required
? ?
verify
opset 17; conversion required
CoreML (Apple)
Verify arch support
Not possible
? ?
verify
opset 17; conversion via coremltools; opset out of range
llama.cpp / Ollama N/A ONNX not supported — requires GGUF format

Model info

Parameters ~
Estimated total number of weight values; determines VRAM needed at inference
233,990,207
Tensors
Total number of weight tensors stored in the file
916
File size
Size on disk in megabytes
893.76 MB
Graph nodes
Total number of computational nodes in the ONNX graph
7496
Opsets
ONNX operator set versions declared by the model
{"ai.onnx": 17}
Producer
Tool or framework that exported this ONNX model
pytorch

Security findings (7)

LOW Supply Chain
No license field in ONNX model metadata
Models without license information cannot be safely redistributed or deployed commercially. ONNX metadata supports a license property in model.metadata_props.
→ Add a license field during export (e.g. apache-2.0, mit, cc-by-4.0)
LOW Supply Chain
No provenance metadata in ONNX model
Neither author nor domain (producer namespace) are set. Without origin information the model cannot be traced to a trusted source.
→ Set author and domain fields during model export
INFO Shape Risk
Dynamic tensor dimensions detected
Inputs with dynamic dims: ['speech']. Outputs: ['encoder_out'] (symbolic: Addencoder_out_dim_0, encoder_out_length, speech_length). Dynamic dims allow flexible batch sizes and sequence lengths, but without enforced bounds a caller can supply arbitrarily large tensors causing OOM. This is expected for most inference models.
→ Enforce maximum input shape at the serving layer (e.g. ORT SessionOptions.add_session_config_entry, preprocessing validation). Document accepted input bounds in model card or deployment README.
INFO Resources
Large ONNX graph — 7,496 graph nodes / ~234M parameters
This model has 7,496 nodes, 916 initializers, 233,990,207 parameters, and 936.0 MB of declared weights. Larger graphs have higher memory allocation overhead at load time and may hit per-request limits in serving frameworks.
→ Validate memory and latency under representative maximum input length. Set request concurrency and input-size limits before exposing the model as a service.
INFO Provenance
Model producer: pytorch 2.3.0
Producer metadata helps identify the tool that exported this model
→ Verify producer matches expected export pipeline
INFO Classification
Inferred model type: audio-speech
Based on op inventory (7496 total nodes, 28 unique types)
→ Verify this matches the model's intended use case
INFO Runtime
Default opset: 17
Opset governs which ops and behaviors are available at runtime
→ Use ONNX Runtime (CPU/CUDA/DirectML/OpenVINO backends); requires ORT ≥ 1.14

Integrity & Structure

SHA-256b1145eb7e9d2dbb9005fc99ed0313efebfadffea4aee1f4fa68b69a359126227
SHA-512277a42c8b1dc47f55df706d9b5bf51b43324b792c628cdb149103d9145cd773173b0eb1eecb34952…
File size937,179,517 bytes (893.76 MB)
Declared weight bytes935,960,828 (892.6 MB)
Non-weight overhead1.16 MB
Initializers (weights)916
Graph nodes7496

Custom Operators & Domains

Standard ops only
All operators use the standard ai.onnx or ai.onnx.ml domain. No custom kernels, no vendor-specific ops.
DomainTypeOpsRuntime requirement
ai.onnx Standard None — supported by all ONNX runtimes

Initializer Integrity

✓ All initializer integrity checks passed.
CheckCountStatus
Inline tensor byte-size mismatches
raw_data length vs declared shape × dtype_bytes
0 PASS
Empty initializers
Non-zero shape declared but no inline or external data
0 PASS
Duplicate initializer names
ONNX spec requires unique names; duplicates cause non-deterministic behaviour
0 PASS
Initializers not used by graph
Present in graph.initializer but not referenced by any node input
0 PASS
Graph inputs shadowing initializers
Per ONNX spec these become optional overridable weights; runtime behaviour varies
0 PASS
NaN / Inf numeric scan
Sampled scan — 14,937,359 values across 916 / 916 float tensor(s)
0 PASS (sampled)

Operator Risk Profile

⚠ Elevated-risk operator categories detected — review summary below before deployment.
Risk categoryOperators in this model
▪ Control-flow ops
Loop, If, Scan — conditional/recursive execution
none
⚠ Memory amplification
ConstantOfShape, Expand, Tile — size from runtime shapes
ConstantOfShape ×70
▪ Provider compat
NMS, RoiAlign, GridSample — not in all runtimes
none
⚠ Runtime-sensitive ops
Scatter, Gather, Resize — edge-case differences
Gather ×563
▪ Quantized ops
QuantizeLinear, QLinearConv — quantized path required
none
▪ Non-deterministic ops
Random*, Multinomial — output varies between runs
none
▪ String processing ops
Tokenizer, TfIdfVectorizer — unusual in weight models
none
▪ Custom ops / domains
Non-standard op domains — may execute arbitrary native code
none
All operators (28 unique types)
OpCountRisk
ConstantOfShape 70 Memory amplification — allocates tensor of declared shape
Gather 563 Runtime-sensitive — index-based gather
Constant 2405
Add 632
Unsqueeze 566
Shape 563
Transpose 490
Reshape 423
MatMul 421
Concat 352
Cast 222
Mul 214
LayerNormalization 142
Split 70
Slice 70
Pad 70
Conv 70
Softmax 70
Relu 70
Range 3
Sub 2
Div 2
ReduceMax 1
Less 1
Neg 1
Exp 1
Sin 1
Cos 1

Shape Risk Analysis

ⓘ Dynamic dims present — standard for flexible inference models. Enforce bounds at serving layer.
Inputs
NameDtypeShapeEst. elements
speech FLOAT [1, speech_length, 560] 560
speech_lengths INT64 [1] 1
Outputs
NameDtypeShapeEst. elements
encoder_out FLOAT [Addencoder_out_dim_0, encoder_out_length, 25055] 25,055
Dynamic dims
Yes
Addencoder_out_dim_0, encoder_out_length, speech_length
Output/Input ratio
44.66×
(dynamic dims assumed = 1)
Shape anomalies
None

External Data Security Checks

No external data — all weight tensors are stored inline in the .onnx file. Checks below are N/A.
CheckResult
External data present
Whether any weight tensors are stored outside the .onnx file
PASS
Absolute paths
Paths starting with / or C:\ escape the model directory
N/A
Path traversal (../)
.. sequences that could read files outside the model directory
N/A
Windows drive paths (C:\)
Drive-letter paths are always absolute and OS-specific
N/A
Remote / URL paths
http://, ftp:// etc. would trigger network requests at load time
N/A
Null bytes in paths
Null-byte injection truncates paths in C/C++ runtimes
N/A
Duplicate file references
Same external file referenced by multiple tensors
N/A
Missing external files
Referenced files not present on disk at scan time
N/A
Out-of-bounds reads
offset + length exceeds the external file size
N/A
Offset/length range validated
Verified that each tensor's offset+length fits within the external file
N/A

DType Mix

DTypeCountTotal bytesTotal MBAvg bits/elem
FLOAT 916 935,960,828 892.6 32.0

Op Distribution (top 20)

Initializer Preview (first 50 of 916)

#NameShapeDTypeBytesbits/elem
0 model.encoders0.self_attn.linear_out.bias [512] FLOAT 2,048 32.0
1 model.encoders0.self_attn.linear_q_k_v.bias [1536] FLOAT 6,144 32.0
2 model.encoders0.self_attn.fsmn_block.weight [512, 1, 11] FLOAT 22,528 32.0
3 model.encoders0.feed_forward.w_1.bias [2048] FLOAT 8,192 32.0
4 model.encoders0.feed_forward.w_2.bias [512] FLOAT 2,048 32.0
5 model.encoders.0.self_attn.linear_out.bias [512] FLOAT 2,048 32.0
6 model.encoders.0.self_attn.linear_q_k_v.bias [1536] FLOAT 6,144 32.0
7 model.encoders.0.self_attn.fsmn_block.weight [512, 1, 11] FLOAT 22,528 32.0
8 model.encoders.0.feed_forward.w_1.bias [2048] FLOAT 8,192 32.0
9 model.encoders.0.feed_forward.w_2.bias [512] FLOAT 2,048 32.0
10 model.encoders.1.self_attn.linear_out.bias [512] FLOAT 2,048 32.0
11 model.encoders.1.self_attn.linear_q_k_v.bias [1536] FLOAT 6,144 32.0
12 model.encoders.1.self_attn.fsmn_block.weight [512, 1, 11] FLOAT 22,528 32.0
13 model.encoders.1.feed_forward.w_1.bias [2048] FLOAT 8,192 32.0
14 model.encoders.1.feed_forward.w_2.bias [512] FLOAT 2,048 32.0
15 model.encoders.2.self_attn.linear_out.bias [512] FLOAT 2,048 32.0
16 model.encoders.2.self_attn.linear_q_k_v.bias [1536] FLOAT 6,144 32.0
17 model.encoders.2.self_attn.fsmn_block.weight [512, 1, 11] FLOAT 22,528 32.0
18 model.encoders.2.feed_forward.w_1.bias [2048] FLOAT 8,192 32.0
19 model.encoders.2.feed_forward.w_2.bias [512] FLOAT 2,048 32.0
20 model.encoders.3.self_attn.linear_out.bias [512] FLOAT 2,048 32.0
21 model.encoders.3.self_attn.linear_q_k_v.bias [1536] FLOAT 6,144 32.0
22 model.encoders.3.self_attn.fsmn_block.weight [512, 1, 11] FLOAT 22,528 32.0
23 model.encoders.3.feed_forward.w_1.bias [2048] FLOAT 8,192 32.0
24 model.encoders.3.feed_forward.w_2.bias [512] FLOAT 2,048 32.0
25 model.encoders.4.self_attn.linear_out.bias [512] FLOAT 2,048 32.0
26 model.encoders.4.self_attn.linear_q_k_v.bias [1536] FLOAT 6,144 32.0
27 model.encoders.4.self_attn.fsmn_block.weight [512, 1, 11] FLOAT 22,528 32.0
28 model.encoders.4.feed_forward.w_1.bias [2048] FLOAT 8,192 32.0
29 model.encoders.4.feed_forward.w_2.bias [512] FLOAT 2,048 32.0
30 model.encoders.5.self_attn.linear_out.bias [512] FLOAT 2,048 32.0
31 model.encoders.5.self_attn.linear_q_k_v.bias [1536] FLOAT 6,144 32.0
32 model.encoders.5.self_attn.fsmn_block.weight [512, 1, 11] FLOAT 22,528 32.0
33 model.encoders.5.feed_forward.w_1.bias [2048] FLOAT 8,192 32.0
34 model.encoders.5.feed_forward.w_2.bias [512] FLOAT 2,048 32.0
35 model.encoders.6.self_attn.linear_out.bias [512] FLOAT 2,048 32.0
36 model.encoders.6.self_attn.linear_q_k_v.bias [1536] FLOAT 6,144 32.0
37 model.encoders.6.self_attn.fsmn_block.weight [512, 1, 11] FLOAT 22,528 32.0
38 model.encoders.6.feed_forward.w_1.bias [2048] FLOAT 8,192 32.0
39 model.encoders.6.feed_forward.w_2.bias [512] FLOAT 2,048 32.0
40 model.encoders.7.self_attn.linear_out.bias [512] FLOAT 2,048 32.0
41 model.encoders.7.self_attn.linear_q_k_v.bias [1536] FLOAT 6,144 32.0
42 model.encoders.7.self_attn.fsmn_block.weight [512, 1, 11] FLOAT 22,528 32.0
43 model.encoders.7.feed_forward.w_1.bias [2048] FLOAT 8,192 32.0
44 model.encoders.7.feed_forward.w_2.bias [512] FLOAT 2,048 32.0
45 model.encoders.8.self_attn.linear_out.bias [512] FLOAT 2,048 32.0
46 model.encoders.8.self_attn.linear_q_k_v.bias [1536] FLOAT 6,144 32.0
47 model.encoders.8.self_attn.fsmn_block.weight [512, 1, 11] FLOAT 22,528 32.0
48 model.encoders.8.feed_forward.w_1.bias [2048] FLOAT 8,192 32.0
49 model.encoders.8.feed_forward.w_2.bias [512] FLOAT 2,048 32.0
… 866 more initializers omitted

Scan coverage

Checks performed
  • ONNX protobuf parse
  • Opset version check
  • Node count & op histogram
  • Custom domain detection
  • External data reference check
  • Structural validation (ONNX checker)
  • Metadata key scan
  • Weight size estimate vs file size
  • Embedded supply-chain metadata (license, author, provenance fields)
  • Runtime compatibility heuristics
  • External model card / repository context: not available for local upload
  • Upstream repository: not checked — not available for direct file upload
Not covered
  • Runtime execution or dynamic analysis
  • Behavioral backdoor detection
  • Weight-level semantic backdoor detection
  • Full upstream repository verification
  • License validation beyond embedded metadata
  • Malware scanning of surrounding repo files
  • Adversarial robustness or alignment audit
  • Training data provenance
ⓘ Static scanning can detect structural anomalies and known malicious patterns. It cannot guarantee absence of risk. Treat results as a security signal, not a formal audit.
Raw scan data (.llmscan JSON)
{
  "compatibility": [
    {
      "arch": true,
      "context": "opset 17 (requires ORT \u2265 1.14)",
      "conversion_possible": true,
      "direct_supported": true,
      "notes": "ONNX Runtime (CPU/CUDA/DirectML/OpenVINO backends); requires ORT \u2265 1.14",
      "quant": null,
      "runtime": "ONNX Runtime",
      "verification_required": false
    },
    {
      "arch": null,
      "context": "opset 17",
      "conversion_possible": true,
      "direct_supported": false,
      "notes": "Engine build required (trtexec / TRT Python API)",
      "quant": null,
      "runtime": "TensorRT",
      "verification_required": true
    },
    {
      "arch": null,
      "context": "opset 17; conversion required",
      "conversion_possible": true,
      "direct_supported": false,
      "notes": "Conversion via Model Optimizer (mo) or OpenVINO OVC (openvino.convert_model) required | Op coverage varies; validate with mo --input_model before deployment",
      "quant": null,
      "runtime": "OpenVINO",
      "verification_required": true
    },
    {
      "arch": null,
      "context": "opset 17; conversion via coremltools; opset out of range",
      "conversion_possible": false,
      "direct_supported": false,
      "notes": "Conversion path via coremltools.converters.onnx.convert() \u2014 CoreML is not a direct ONNX runtime; the model must be converted to .mlpackage first. opset 17 exceeds CoreML converter limit (\u2264 16). ",
      "quant": null,
      "runtime": "CoreML (Apple)",
      "verification_required": true
    },
    {
      "arch": null,
      "context": null,
      "conversion_possible": false,
      "direct_supported": false,
      "not_supported_msg": "ONNX not supported \u2014 requires GGUF format",
      "notes": "GGUF format only; convert with llama.cpp convert scripts",
      "quant": false,
      "runtime": "llama.cpp / Ollama",
      "verification_required": false
    }
  ],
  "format": "LLM-SCAN",
  "format_version": "1.0",
  "generator": {
    "name": "llmscan-engine",
    "version": "2.0.0"
  },
  "model": {
    "arch": null,
    "custom_domains": [],
    "declared_weight_bytes": 935960828,
    "declared_weight_mb": 892.6,
    "domain": "",
    "dtype_hist": {
      "FLOAT": 233990207
    },
    "dtype_stats": {
      "FLOAT": {
        "avg_bits_per_elem": 32.0,
        "bytes": 935960828,
        "count": 916,
        "mb": 892.6
      }
    },
    "external_refs": [],
    "file_size_bytes": 937179517,
    "file_size_mb": 893.76,
    "format": "onnx",
    "has_external_data": false,
    "initialized_tensors": 916,
    "inputs": [
      {
        "dtype": "FLOAT",
        "name": "speech",
        "shape": [
          1,
          "speech_length",
          560
        ]
      },
      {
        "dtype": "INT64",
        "name": "speech_lengths",
        "shape": [
          1
        ]
      }
    ],
    "ir_version": 8,
    "kv_meta": {},
    "model_type": "audio-speech",
    "nodes": 7496,
    "op_hist_top": {
      "Add": 632,
      "Cast": 222,
      "Concat": 352,
      "Constant": 2405,
      "ConstantOfShape": 70,
      "Conv": 70,
      "Cos": 1,
      "Div": 2,
      "Exp": 1,
      "Gather": 563,
      "LayerNormalization": 142,
      "Less": 1,
      "MatMul": 421,
      "Mul": 214,
      "Neg": 1,
      "Pad": 70,
      "Range": 3,
      "ReduceMax": 1,
      "Relu": 70,
      "Reshape": 423,
      "Shape": 563,
      "Sin": 1,
      "Slice": 70,
      "Softmax": 70,
      "Split": 70,
      "Sub": 2,
      "Transpose": 490,
      "Unsqueeze": 566
    },
    "opsets": {
      "ai.onnx": 17
    },
    "outputs": [
      {
        "dtype": "FLOAT",
        "name": "encoder_out",
        "shape": [
          "Addencoder_out_dim_0",
          "encoder_out_length",
          25055
        ]
      }
    ],
    "params_estimate": 233990207,
    "producer": "pytorch",
    "quantization": null,
    "quantized": false,
    "scanner_model_info": {
      "custom_domain_detail": {},
      "custom_domains": [],
      "custom_ops_report": {
        "domains": [],
        "has_non_standard": false,
        "standard_only": true
      },
      "declared_weight_bytes": 935960828,
      "declared_weight_mb": 892.6,
      "doc_string": null,
      "domain": "",
      "dtype_histogram": {
        "FLOAT": 233990207
      },
      "dtype_stats": {
        "FLOAT": {
          "avg_bits_per_elem": 32.0,
          "bytes": 935960828,
          "count": 916,
          "mb": 892.6
        }
      },
      "external_data_checks": {
        "absolute_paths": [],
        "duplicate_files": [],
        "missing_files": [],
        "null_byte_paths": [],
        "oob_reads": [],
        "present": false,
        "remote_url_paths": [],
        "size_validated_count": 0,
        "size_validation_total": 0,
        "tensor_count": 0,
        "traversal_detected": [],
        "windows_drive_paths": []
      },
      "external_refs": [],
      "extreme_dim_tensors": 0,
      "file_size_bytes": 937179517,
      "file_size_mb": 893.76,
      "has_external_data": false,
      "initializer_integrity": {
        "count": 916,
        "duplicate_name_list": [],
        "duplicate_names": 0,
        "empty_initializers": 0,
        "inline_tensor_mismatches": 0,
        "nan_inf_scan": {
          "affected_tensors": [],
          "inf_count": 0,
          "method": "sampled",
          "nan_count": 0,
          "performed": true,
          "tensors_scanned": 916,
          "total_float_tensors": 916,
          "values_scanned": 14937359
        },
        "shadowing_graph_inputs": 0,
        "shadowing_names": [],
        "unused_by_graph": 0,
        "unused_names": []
      },
      "inline_tensor_mismatches": 0,
      "inputs": [
        {
          "dtype": "FLOAT",
          "name": "speech",
          "shape": [
            1,
            "speech_length",
            560
          ]
        },
        {
          "dtype": "INT64",
          "name": "speech_lengths",
          "shape": [
            1
          ]
        }
      ],
      "ir_version": 8,
      "metadata_props": {},
      "model_type": "audio-speech",
      "model_version": 0,
      "node_count": 7496,
      "op_histogram": {
        "Add": 632,
        "Cast": 222,
        "Concat": 352,
        "Constant": 2405,
        "ConstantOfShape": 70,
        "Conv": 70,
        "Cos": 1,
        "Div": 2,
        "Exp": 1,
        "Gather": 563,
        "LayerNormalization": 142,
        "Less": 1,
        "MatMul": 421,
        "Mul": 214,
        "Neg": 1,
        "Pad": 70,
        "Range": 3,
        "ReduceMax": 1,
        "Relu": 70,
        "Reshape": 423,
        "Shape": 563,
        "Sin": 1,
        "Slice": 70,
        "Softmax": 70,
        "Split": 70,
        "Sub": 2,
        "Transpose": 490,
        "Unsqueeze": 566
      },
      "op_histogram_full": {
        "Add": 632,
        "Cast": 222,
        "Concat": 352,
        "Constant": 2405,
        "ConstantOfShape": 70,
        "Conv": 70,
        "Cos": 1,
        "Div": 2,
        "Exp": 1,
        "Gather": 563,
        "LayerNormalization": 142,
        "Less": 1,
        "MatMul": 421,
        "Mul": 214,
        "Neg": 1,
        "Pad": 70,
        "Range": 3,
        "ReduceMax": 1,
        "Relu": 70,
        "Reshape": 423,
        "Shape": 563,
        "Sin": 1,
        "Slice": 70,
        "Softmax": 70,
        "Split": 70,
        "Sub": 2,
        "Transpose": 490,
        "Unsqueeze": 566
      },
      "op_risk_report": {
        "elevated_categories": [
          "memory_amp",
          "runtime_sensitive"
        ],
        "has_control_flow": false,
        "has_memory_amp": true,
        "has_nondeterministic": false,
        "has_provider_compat": false,
        "has_quantized": false,
        "has_runtime_sensitive": true,
        "has_string_ops": false,
        "rows": [
          {
            "count": 70,
            "note": "Memory amplification \u2014 allocates tensor of declared shape",
            "op": "ConstantOfShape",
            "risk": "memory_amp"
          },
          {
            "count": 563,
            "note": "Runtime-sensitive \u2014 index-based gather",
            "op": "Gather",
            "risk": "runtime_sensitive"
          },
          {
            "count": 2405,
            "note": "Standard ONNX op",
            "op": "Constant",
            "risk": "normal"
          },
          {
            "count": 632,
            "note": "Standard ONNX op",
            "op": "Add",
            "risk": "normal"
          },
          {
            "count": 566,
            "note": "Standard ONNX op",
            "op": "Unsqueeze",
            "risk": "normal"
          },
          {
            "count": 563,
            "note": "Standard ONNX op",
            "op": "Shape",
            "risk": "normal"
          },
          {
            "count": 490,
            "note": "Standard ONNX op",
            "op": "Transpose",
            "risk": "normal"
          },
          {
            "count": 423,
            "note": "Standard ONNX op",
            "op": "Reshape",
            "risk": "normal"
          },
          {
            "count": 421,
            "note": "Standard ONNX op",
            "op": "MatMul",
            "risk": "normal"
          },
          {
            "count": 352,
            "note": "Standard ONNX op",
            "op": "Concat",
            "risk": "normal"
          },
          {
            "count": 222,
            "note": "Standard ONNX op",
            "op": "Cast",
            "risk": "normal"
          },
          {
            "count": 214,
            "note": "Standard ONNX op",
            "op": "Mul",
            "risk": "normal"
          },
          {
            "count": 142,
            "note": "Standard ONNX op",
            "op": "LayerNormalization",
            "risk": "normal"
          },
          {
            "count": 70,
            "note": "Standard ONNX op",
            "op": "Split",
            "risk": "normal"
          },
          {
            "count": 70,
            "note": "Standard ONNX op",
            "op": "Slice",
            "risk": "normal"
          },
          {
            "count": 70,
            "note": "Standard ONNX op",
            "op": "Pad",
            "risk": "normal"
          },
          {
            "count": 70,
            "note": "Standard ONNX op",
            "op": "Conv",
            "risk": "normal"
          },
          {
            "count": 70,
            "note": "Standard ONNX op",
            "op": "Softmax",
            "risk": "normal"
          },
          {
            "count": 70,
            "note": "Standard ONNX op",
            "op": "Relu",
            "risk": "normal"
          },
          {
            "count": 3,
            "note": "Standard ONNX op",
            "op": "Range",
            "risk": "normal"
          },
          {
            "count": 2,
            "note": "Standard ONNX op",
            "op": "Sub",
            "risk": "normal"
          },
          {
            "count": 2,
            "note": "Standard ONNX op",
            "op": "Div",
            "risk": "normal"
          },
          {
            "count": 1,
            "note": "Standard ONNX op",
            "op": "ReduceMax",
            "risk": "normal"
          },
          {
            "count": 1,
            "note": "Standard ONNX op",
            "op": "Less",
            "risk": "normal"
          },
          {
            "count": 1,
            "note": "Standard ONNX op",
            "op": "Neg",
            "risk": "normal"
          },
          {
            "count": 1,
            "note": "Standard ONNX op",
            "op": "Exp",
            "risk": "normal"
          },
          {
            "count": 1,
            "note": "Standard ONNX op",
            "op": "Sin",
            "risk": "normal"
          },
          {
            "count": 1,
            "note": "Standard ONNX op",
            "op": "Cos",
            "risk": "normal"
          }
        ]
      },
      "opsets": {
        "ai.onnx": 17
      },
      "outputs": [
        {
          "dtype": "FLOAT",
          "name": "encoder_out",
          "shape": [
            "Addencoder_out_dim_0",
            "encoder_out_length",
            25055
          ]
        }
      ],
      "param_estimate": 233990207,
      "producer_name": "pytorch",
      "producer_version": "2.3.0",
      "quantized": false,
      "sha256": "b1145eb7e9d2dbb9005fc99ed0313efebfadffea4aee1f4fa68b69a359126227",
      "sha512": "277a42c8b1dc47f55df706d9b5bf51b43324b792c628cdb149103d9145cd773173b0eb1eecb34952d389a999de2b4d57dc6703b305480b43d8f439885ba0ab70",
      "shape_risk_report": {
        "amplification_ratio": 44.66,
        "any_dynamic_dims": true,
        "dynamic_dim_names": [
          "Addencoder_out_dim_0",
          "encoder_out_length",
          "speech_length"
        ],
        "extreme_dims_detected": false,
        "input_elements_est": 561,
        "inputs": [
          {
            "dtype": "FLOAT",
            "est_elements": 560,
            "has_dynamic": true,
            "has_negative": false,
            "name": "speech",
            "shape": [
              1,
              "speech_length",
              560
            ]
          },
          {
            "dtype": "INT64",
            "est_elements": 1,
            "has_dynamic": false,
            "has_negative": false,
            "name": "speech_lengths",
            "shape": [
              1
            ]
          }
        ],
        "negative_dims_detected": false,
        "output_elements_est": 25055,
        "outputs": [
          {
            "dtype": "FLOAT",
            "est_elements": 25055,
            "has_dynamic": true,
            "has_negative": false,
            "name": "encoder_out",
            "shape": [
              "Addencoder_out_dim_0",
              "encoder_out_length",
              25055
            ]
          }
        ]
      },
      "tensor_count": 916,
      "tensor_preview": [
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 0,
          "name": "model.encoders0.self_attn.linear_out.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 6144,
          "dims": [
            1536
          ],
          "dtype_name": "FLOAT",
          "index": 1,
          "name": "model.encoders0.self_attn.linear_q_k_v.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 22528,
          "dims": [
            512,
            1,
            11
          ],
          "dtype_name": "FLOAT",
          "index": 2,
          "name": "model.encoders0.self_attn.fsmn_block.weight"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 8192,
          "dims": [
            2048
          ],
          "dtype_name": "FLOAT",
          "index": 3,
          "name": "model.encoders0.feed_forward.w_1.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 4,
          "name": "model.encoders0.feed_forward.w_2.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 5,
          "name": "model.encoders.0.self_attn.linear_out.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 6144,
          "dims": [
            1536
          ],
          "dtype_name": "FLOAT",
          "index": 6,
          "name": "model.encoders.0.self_attn.linear_q_k_v.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 22528,
          "dims": [
            512,
            1,
            11
          ],
          "dtype_name": "FLOAT",
          "index": 7,
          "name": "model.encoders.0.self_attn.fsmn_block.weight"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 8192,
          "dims": [
            2048
          ],
          "dtype_name": "FLOAT",
          "index": 8,
          "name": "model.encoders.0.feed_forward.w_1.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 9,
          "name": "model.encoders.0.feed_forward.w_2.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 10,
          "name": "model.encoders.1.self_attn.linear_out.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 6144,
          "dims": [
            1536
          ],
          "dtype_name": "FLOAT",
          "index": 11,
          "name": "model.encoders.1.self_attn.linear_q_k_v.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 22528,
          "dims": [
            512,
            1,
            11
          ],
          "dtype_name": "FLOAT",
          "index": 12,
          "name": "model.encoders.1.self_attn.fsmn_block.weight"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 8192,
          "dims": [
            2048
          ],
          "dtype_name": "FLOAT",
          "index": 13,
          "name": "model.encoders.1.feed_forward.w_1.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 14,
          "name": "model.encoders.1.feed_forward.w_2.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 15,
          "name": "model.encoders.2.self_attn.linear_out.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 6144,
          "dims": [
            1536
          ],
          "dtype_name": "FLOAT",
          "index": 16,
          "name": "model.encoders.2.self_attn.linear_q_k_v.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 22528,
          "dims": [
            512,
            1,
            11
          ],
          "dtype_name": "FLOAT",
          "index": 17,
          "name": "model.encoders.2.self_attn.fsmn_block.weight"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 8192,
          "dims": [
            2048
          ],
          "dtype_name": "FLOAT",
          "index": 18,
          "name": "model.encoders.2.feed_forward.w_1.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 19,
          "name": "model.encoders.2.feed_forward.w_2.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 20,
          "name": "model.encoders.3.self_attn.linear_out.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 6144,
          "dims": [
            1536
          ],
          "dtype_name": "FLOAT",
          "index": 21,
          "name": "model.encoders.3.self_attn.linear_q_k_v.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 22528,
          "dims": [
            512,
            1,
            11
          ],
          "dtype_name": "FLOAT",
          "index": 22,
          "name": "model.encoders.3.self_attn.fsmn_block.weight"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 8192,
          "dims": [
            2048
          ],
          "dtype_name": "FLOAT",
          "index": 23,
          "name": "model.encoders.3.feed_forward.w_1.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 24,
          "name": "model.encoders.3.feed_forward.w_2.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 25,
          "name": "model.encoders.4.self_attn.linear_out.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 6144,
          "dims": [
            1536
          ],
          "dtype_name": "FLOAT",
          "index": 26,
          "name": "model.encoders.4.self_attn.linear_q_k_v.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 22528,
          "dims": [
            512,
            1,
            11
          ],
          "dtype_name": "FLOAT",
          "index": 27,
          "name": "model.encoders.4.self_attn.fsmn_block.weight"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 8192,
          "dims": [
            2048
          ],
          "dtype_name": "FLOAT",
          "index": 28,
          "name": "model.encoders.4.feed_forward.w_1.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 29,
          "name": "model.encoders.4.feed_forward.w_2.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 30,
          "name": "model.encoders.5.self_attn.linear_out.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 6144,
          "dims": [
            1536
          ],
          "dtype_name": "FLOAT",
          "index": 31,
          "name": "model.encoders.5.self_attn.linear_q_k_v.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 22528,
          "dims": [
            512,
            1,
            11
          ],
          "dtype_name": "FLOAT",
          "index": 32,
          "name": "model.encoders.5.self_attn.fsmn_block.weight"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 8192,
          "dims": [
            2048
          ],
          "dtype_name": "FLOAT",
          "index": 33,
          "name": "model.encoders.5.feed_forward.w_1.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 34,
          "name": "model.encoders.5.feed_forward.w_2.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 35,
          "name": "model.encoders.6.self_attn.linear_out.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 6144,
          "dims": [
            1536
          ],
          "dtype_name": "FLOAT",
          "index": 36,
          "name": "model.encoders.6.self_attn.linear_q_k_v.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 22528,
          "dims": [
            512,
            1,
            11
          ],
          "dtype_name": "FLOAT",
          "index": 37,
          "name": "model.encoders.6.self_attn.fsmn_block.weight"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 8192,
          "dims": [
            2048
          ],
          "dtype_name": "FLOAT",
          "index": 38,
          "name": "model.encoders.6.feed_forward.w_1.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 39,
          "name": "model.encoders.6.feed_forward.w_2.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 40,
          "name": "model.encoders.7.self_attn.linear_out.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 6144,
          "dims": [
            1536
          ],
          "dtype_name": "FLOAT",
          "index": 41,
          "name": "model.encoders.7.self_attn.linear_q_k_v.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 22528,
          "dims": [
            512,
            1,
            11
          ],
          "dtype_name": "FLOAT",
          "index": 42,
          "name": "model.encoders.7.self_attn.fsmn_block.weight"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 8192,
          "dims": [
            2048
          ],
          "dtype_name": "FLOAT",
          "index": 43,
          "name": "model.encoders.7.feed_forward.w_1.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 44,
          "name": "model.encoders.7.feed_forward.w_2.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 45,
          "name": "model.encoders.8.self_attn.linear_out.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 6144,
          "dims": [
            1536
          ],
          "dtype_name": "FLOAT",
          "index": 46,
          "name": "model.encoders.8.self_attn.linear_q_k_v.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 22528,
          "dims": [
            512,
            1,
            11
          ],
          "dtype_name": "FLOAT",
          "index": 47,
          "name": "model.encoders.8.self_attn.fsmn_block.weight"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 8192,
          "dims": [
            2048
          ],
          "dtype_name": "FLOAT",
          "index": 48,
          "name": "model.encoders.8.feed_forward.w_1.bias"
        },
        {
          "bits_per_elem": 32.0,
          "byte_len": 2048,
          "dims": [
            512
          ],
          "dtype_name": "FLOAT",
          "index": 49,
          "name": "model.encoders.8.feed_forward.w_2.bias"
        }
      ],
      "unique_op_types": 28,
      "weight_delta_bytes": 1218689,
      "weight_delta_mb": 1.16,
      "weights_size_bytes": 935960828,
      "weights_size_mb": 892.6,
      "zero_dim_initializers": 0
    },
    "sha256": "b1145eb7e9d2dbb9005fc99ed0313efebfadffea4aee1f4fa68b69a359126227",
    "sha512": "277a42c8b1dc47f55df706d9b5bf51b43324b792c628cdb149103d9145cd773173b0eb1eecb34952d389a999de2b4d57dc6703b305480b43d8f439885ba0ab70",
    "tensor_preview": [
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 0,
        "name": "model.encoders0.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 1,
        "name": "model.encoders0.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 2,
        "name": "model.encoders0.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 3,
        "name": "model.encoders0.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 4,
        "name": "model.encoders0.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 5,
        "name": "model.encoders.0.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 6,
        "name": "model.encoders.0.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 7,
        "name": "model.encoders.0.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 8,
        "name": "model.encoders.0.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 9,
        "name": "model.encoders.0.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 10,
        "name": "model.encoders.1.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 11,
        "name": "model.encoders.1.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 12,
        "name": "model.encoders.1.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 13,
        "name": "model.encoders.1.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 14,
        "name": "model.encoders.1.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 15,
        "name": "model.encoders.2.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 16,
        "name": "model.encoders.2.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 17,
        "name": "model.encoders.2.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 18,
        "name": "model.encoders.2.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 19,
        "name": "model.encoders.2.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 20,
        "name": "model.encoders.3.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 21,
        "name": "model.encoders.3.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 22,
        "name": "model.encoders.3.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 23,
        "name": "model.encoders.3.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 24,
        "name": "model.encoders.3.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 25,
        "name": "model.encoders.4.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 26,
        "name": "model.encoders.4.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 27,
        "name": "model.encoders.4.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 28,
        "name": "model.encoders.4.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 29,
        "name": "model.encoders.4.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 30,
        "name": "model.encoders.5.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 31,
        "name": "model.encoders.5.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 32,
        "name": "model.encoders.5.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 33,
        "name": "model.encoders.5.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 34,
        "name": "model.encoders.5.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 35,
        "name": "model.encoders.6.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 36,
        "name": "model.encoders.6.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 37,
        "name": "model.encoders.6.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 38,
        "name": "model.encoders.6.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 39,
        "name": "model.encoders.6.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 40,
        "name": "model.encoders.7.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 41,
        "name": "model.encoders.7.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 42,
        "name": "model.encoders.7.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 43,
        "name": "model.encoders.7.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 44,
        "name": "model.encoders.7.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 45,
        "name": "model.encoders.8.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 46,
        "name": "model.encoders.8.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 47,
        "name": "model.encoders.8.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 48,
        "name": "model.encoders.8.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 49,
        "name": "model.encoders.8.feed_forward.w_2.bias"
      }
    ],
    "weight_delta_mb": 1.16,
    "weights_size_est_bytes": 935960828
  },
  "report": {
    "bullets": [
      "ONNX audio-speech model | opset 17 | 7496 nodes | 233,990,207 params | 2 warnings / 5 informational",
      "Size: 893.76 MB",
      "SHA256: b1145eb7e9d2dbb9..."
    ],
    "recommendations": [
      "Add a license field during export (e.g. apache-2.0, mit, cc-by-4.0)",
      "Set author and domain fields during model export"
    ],
    "summary": "ONNX audio-speech model | opset 17 | 7496 nodes | 233,990,207 params | 2 warnings / 5 informational"
  },
  "scan_context": {
    "duration_ms": 10925,
    "ended_at": "2026-07-09T10:30:38+00:00Z",
    "limits": {
      "sandbox": true,
      "timeout_ms": 60000
    },
    "mode": "static-deep",
    "started_at": "2026-07-09T10:30:38+00:00Z"
  },
  "security": {
    "findings": [
      {
        "category": "Shape Risk",
        "detail": "Inputs with dynamic dims: [\u0027speech\u0027]. Outputs: [\u0027encoder_out\u0027] (symbolic: Addencoder_out_dim_0, encoder_out_length, speech_length). Dynamic dims allow flexible batch sizes and sequence lengths, but without enforced bounds a caller can supply arbitrarily large tensors causing OOM. This is expected for most inference models.",
        "recommendation": "Enforce maximum input shape at the serving layer (e.g. ORT SessionOptions.add_session_config_entry, preprocessing validation). Document accepted input bounds in model card or deployment README.",
        "severity": "INFO",
        "title": "Dynamic tensor dimensions detected"
      },
      {
        "category": "Supply Chain",
        "detail": "Models without license information cannot be safely redistributed or deployed commercially. ONNX metadata supports a license property in model.metadata_props.",
        "recommendation": "Add a license field during export (e.g. apache-2.0, mit, cc-by-4.0)",
        "severity": "LOW",
        "title": "No license field in ONNX model metadata"
      },
      {
        "category": "Supply Chain",
        "detail": "Neither author nor domain (producer namespace) are set. Without origin information the model cannot be traced to a trusted source.",
        "recommendation": "Set author and domain fields during model export",
        "severity": "LOW",
        "title": "No provenance metadata in ONNX model"
      },
      {
        "category": "Resources",
        "detail": "This model has 7,496 nodes, 916 initializers, 233,990,207 parameters, and 936.0 MB of declared weights. Larger graphs have higher memory allocation overhead at load time and may hit per-request limits in serving frameworks.",
        "recommendation": "Validate memory and latency under representative maximum input length. Set request concurrency and input-size limits before exposing the model as a service.",
        "severity": "INFO",
        "title": "Large ONNX graph \u2014 7,496 graph nodes / ~234M parameters"
      },
      {
        "category": "Provenance",
        "detail": "Producer metadata helps identify the tool that exported this model",
        "recommendation": "Verify producer matches expected export pipeline",
        "severity": "INFO",
        "title": "Model producer: pytorch 2.3.0"
      },
      {
        "category": "Classification",
        "detail": "Based on op inventory (7496 total nodes, 28 unique types)",
        "recommendation": "Verify this matches the model\u0027s intended use case",
        "severity": "INFO",
        "title": "Inferred model type: audio-speech"
      },
      {
        "category": "Runtime",
        "detail": "Opset governs which ops and behaviors are available at runtime",
        "recommendation": "Use ONNX Runtime (CPU/CUDA/DirectML/OpenVINO backends); requires ORT \u2265 1.14",
        "severity": "INFO",
        "title": "Default opset: 17"
      }
    ],
    "grade": "A",
    "score": 94
  },
  "source": {
    "filename": "sense-voice-encoder.onnx",
    "hashes": {
      "sha256": "b1145eb7e9d2dbb9005fc99ed0313efebfadffea4aee1f4fa68b69a359126227"
    },
    "input_type": "file",
    "size_bytes": 937179517
  },
  "tensors": {
    "count": 916,
    "dtype_histogram": {
      "FLOAT": 233990207
    },
    "dtype_stats": {
      "FLOAT": {
        "avg_bits_per_elem": 32.0,
        "bytes": 935960828,
        "count": 916,
        "mb": 892.6
      }
    },
    "integrity": {
      "declared_weight_bytes": 935960828,
      "external_refs": [],
      "has_external_data": false,
      "weight_delta_mb": 1.16,
      "weights_size_est_bytes": 935960828
    },
    "preview": [
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 0,
        "name": "model.encoders0.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 1,
        "name": "model.encoders0.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 2,
        "name": "model.encoders0.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 3,
        "name": "model.encoders0.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 4,
        "name": "model.encoders0.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 5,
        "name": "model.encoders.0.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 6,
        "name": "model.encoders.0.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 7,
        "name": "model.encoders.0.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 8,
        "name": "model.encoders.0.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 9,
        "name": "model.encoders.0.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 10,
        "name": "model.encoders.1.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 11,
        "name": "model.encoders.1.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 12,
        "name": "model.encoders.1.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 13,
        "name": "model.encoders.1.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 14,
        "name": "model.encoders.1.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 15,
        "name": "model.encoders.2.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 16,
        "name": "model.encoders.2.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 17,
        "name": "model.encoders.2.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 18,
        "name": "model.encoders.2.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 19,
        "name": "model.encoders.2.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 20,
        "name": "model.encoders.3.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 21,
        "name": "model.encoders.3.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 22,
        "name": "model.encoders.3.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 23,
        "name": "model.encoders.3.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 24,
        "name": "model.encoders.3.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 25,
        "name": "model.encoders.4.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 26,
        "name": "model.encoders.4.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 27,
        "name": "model.encoders.4.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 28,
        "name": "model.encoders.4.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 29,
        "name": "model.encoders.4.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 30,
        "name": "model.encoders.5.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 31,
        "name": "model.encoders.5.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 32,
        "name": "model.encoders.5.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 33,
        "name": "model.encoders.5.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 34,
        "name": "model.encoders.5.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 35,
        "name": "model.encoders.6.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 36,
        "name": "model.encoders.6.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 37,
        "name": "model.encoders.6.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 38,
        "name": "model.encoders.6.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 39,
        "name": "model.encoders.6.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 40,
        "name": "model.encoders.7.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 41,
        "name": "model.encoders.7.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 42,
        "name": "model.encoders.7.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 43,
        "name": "model.encoders.7.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 44,
        "name": "model.encoders.7.feed_forward.w_2.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 45,
        "name": "model.encoders.8.self_attn.linear_out.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 6144,
        "dims": [
          1536
        ],
        "dtype_name": "FLOAT",
        "index": 46,
        "name": "model.encoders.8.self_attn.linear_q_k_v.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 22528,
        "dims": [
          512,
          1,
          11
        ],
        "dtype_name": "FLOAT",
        "index": 47,
        "name": "model.encoders.8.self_attn.fsmn_block.weight"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 8192,
        "dims": [
          2048
        ],
        "dtype_name": "FLOAT",
        "index": 48,
        "name": "model.encoders.8.feed_forward.w_1.bias"
      },
      {
        "bits_per_elem": 32.0,
        "byte_len": 2048,
        "dims": [
          512
        ],
        "dtype_name": "FLOAT",
        "index": 49,
        "name": "model.encoders.8.feed_forward.w_2.bias"
      }
    ]
  },
  "tokenizer": {}
}