| Base score | 100 |
| LOW No license field in ONNX model metadata | -3 |
| LOW No provenance metadata in ONNX model | -3 |
| LOW Fully dynamic input shapes (1 input(s)) | -3 |
| Penalty subtotal | 91/100 |
| Final | B / 91 |
| Runtime | Status | Quant | Architecture | Context |
|---|---|---|---|---|
| ONNX Runtime |
✓
Direct
|
? | ✓ | opset 17 (requires ORT ≥ 1.14) |
|
TensorRT
Verify arch support
|
⚡
Via conversion
verify required
|
? | ? verify |
opset 17; dynamic batch: needs profiles |
|
OpenVINO
Verify arch support
|
⚡
Via conversion
verify required
|
? | ? verify |
opset 17; conversion required |
|
CoreML (Apple)
Verify arch support
|
✗
Not possible
|
? | ? verify |
opset 17; conversion via coremltools; opset out of range |
| llama.cpp / Ollama | ✗ | N/A | ONNX not supported — requires GGUF format | |
| Parameters ~ Estimated total number of weight values; determines VRAM needed at inference | 608,855,720 |
| Tensors Total number of weight tensors stored in the file | 1229 |
| File size Size on disk in megabytes | 621.97 MB |
| Graph nodes Total number of computational nodes in the ONNX graph | 5654 |
| Opsets ONNX operator set versions declared by the model | {"ai.onnx": 17} |
| Producer Tool or framework that exported this ONNX model | onnx.quantize |
| SHA-256 | 6139d2fa7e1b086097b277c7149725edbab89cc7c7ae64b23c741be4055aff09 |
| SHA-512 | 90d6b7163914efd49ad006071282404b788911b2b26f8a5fe70407f193bbce2194a90a92c9f63cec… |
| File size | 652,183,999 bytes (621.97 MB) |
| Declared weight bytes | 609,822,622 (581.57 MB) |
| Non-weight overhead | 40.4 MB |
| Initializers (weights) | 1229 |
| Graph nodes | 5654 |
ai.onnx or ai.onnx.ml domain. No custom kernels, no vendor-specific ops.| Domain | Type | Ops | Runtime requirement |
|---|---|---|---|
ai.onnx |
Standard | — | None — supported by all ONNX runtimes |
| Check | Count | Status |
|---|---|---|
| Inline tensor byte-size mismatches raw_data length vs declared shape × dtype_bytes |
0 | ✓ PASS |
| Empty initializers Non-zero shape declared but no inline or external data |
0 | ✓ PASS |
| Duplicate initializer names ONNX spec requires unique names; duplicates cause non-deterministic behaviour |
0 | ✓ PASS |
| Initializers not used by graph Present in graph.initializer but not referenced by any node input |
0 | ✓ PASS |
| Graph inputs shadowing initializers Per ONNX spec these become optional overridable weights; runtime behaviour varies |
0 | ✓ PASS |
| NaN / Inf numeric scan
Full scan — 321,792 values across 318 / 318 float tensor(s)
|
0 | ✓ PASS |
| Risk category | Operators in this model |
|---|---|
|
▪ Control-flow ops
Loop, If, Scan — conditional/recursive execution
|
none |
|
⚠ Memory amplification
ConstantOfShape, Expand, Tile — size from runtime shapes
|
ConstantOfShape ×51
Expand ×2
Tile ×1
|
|
▪ Provider compat
NMS, RoiAlign, GridSample — not in all runtimes
|
none |
|
⚠ Runtime-sensitive ops
Scatter, Gather, Resize — edge-case differences
|
Gather ×149
|
|
⚠ Quantized ops
QuantizeLinear, QLinearConv — quantized path required
|
MatMulInteger ×217
ConvInteger ×77
|
|
▪ Non-deterministic ops
Random*, Multinomial — output varies between runs
|
none |
|
▪ String processing ops
Tokenizer, TfIdfVectorizer — unusual in weight models
|
none |
|
▪ Custom ops / domains
Non-standard op domains — may execute arbitrary native code
|
none |
| Op | Count | Risk |
|---|---|---|
| ConstantOfShape | 51 | Memory amplification — allocates tensor of declared shape |
| Expand | 2 | Memory amplification — broadcasts to declared shape |
| Tile | 1 | Memory amplification — replicates input N times |
| Gather | 149 | Runtime-sensitive — index-based gather |
| MatMulInteger | 217 | Quantized model — integer matmul |
| ConvInteger | 77 | Quantized model — integer convolution |
| Constant | 1661 | — |
| Mul | 733 | — |
| Cast | 426 | — |
| Unsqueeze | 328 | — |
| Reshape | 295 | — |
| Transpose | 244 | — |
| DynamicQuantizeLinear | 223 | — |
| Concat | 221 | — |
| Add | 205 | — |
| Shape | 175 | — |
| Slice | 123 | — |
| LayerNormalization | 120 | — |
| Sigmoid | 96 | — |
| Where | 73 | — |
| MatMul | 72 | — |
| Pad | 48 | — |
| Div | 27 | — |
| Squeeze | 24 | — |
| Softmax | 24 | — |
| Split | 24 | — |
| Floor | 3 | — |
| Relu | 3 | — |
| Sub | 2 | — |
| Not | 2 | — |
| And | 2 | — |
| Equal | 1 | — |
| Range | 1 | — |
| Less | 1 | — |
| Name | Dtype | Shape | Est. elements |
|---|---|---|---|
| audio_signal | FLOAT | [audio_signal_dynamic_axes_1, 128, audio_signal_dynamic_axes_2] | 128 |
| length | INT64 | [length_dynamic_axes_1] | 1 |
| Name | Dtype | Shape | Est. elements |
|---|---|---|---|
| outputs | FLOAT | [Transposeoutputs_dim_0, 1024, Transposeoutputs_dim_2] | 1,024 |
| encoded_lengths | INT64 | [length_dynamic_axes_1] | 1 |
| Check | Result |
|---|---|
| External data present Whether any weight tensors are stored outside the .onnx file |
✓ PASS
|
| Absolute paths Paths starting with / or C:\ escape the model directory |
N/A |
| Path traversal (../) .. sequences that could read files outside the model directory |
N/A |
| Windows drive paths (C:\) Drive-letter paths are always absolute and OS-specific |
N/A |
| Remote / URL paths http://, ftp:// etc. would trigger network requests at load time |
N/A |
| Null bytes in paths Null-byte injection truncates paths in C/C++ runtimes |
N/A |
| Duplicate file references Same external file referenced by multiple tensors |
N/A |
| Missing external files Referenced files not present on disk at scan time |
N/A |
| Out-of-bounds reads offset + length exceeds the external file size |
N/A |
| Offset/length range validated Verified that each tensor's offset+length fits within the external file | N/A |
| DType | Count | Total bytes | Total MB | Avg bits/elem |
|---|---|---|---|---|
| FLOAT | 612 | 1,288,344 | 1.23 | 32.0 |
| INT64 | 29 | 736 | 0.0 | 64.0 |
| UINT8 | 588 | 608,533,542 | 580.34 | 8.0 |
| # | Name | Shape | DType | Bytes | bits/elem |
|---|---|---|---|---|---|
| 0 | pre_encode.out.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 1 | pre_encode.conv.0.bias | [256] | FLOAT | 1,024 | 32.0 |
| 2 | pre_encode.conv.2.bias | [256] | FLOAT | 1,024 | 32.0 |
| 3 | pre_encode.conv.3.bias | [256] | FLOAT | 1,024 | 32.0 |
| 4 | pre_encode.conv.5.bias | [256] | FLOAT | 1,024 | 32.0 |
| 5 | pre_encode.conv.6.bias | [256] | FLOAT | 1,024 | 32.0 |
| 6 | layers.0.norm_feed_forward1.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 7 | layers.0.norm_feed_forward1.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 8 | layers.0.norm_conv.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 9 | layers.0.norm_conv.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 10 | layers.0.norm_self_att.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 11 | layers.0.norm_self_att.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 12 | layers.0.self_attn.pos_bias_u | [8, 128] | FLOAT | 4,096 | 32.0 |
| 13 | layers.0.self_attn.pos_bias_v | [8, 128] | FLOAT | 4,096 | 32.0 |
| 14 | layers.0.norm_feed_forward2.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 15 | layers.0.norm_feed_forward2.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 16 | layers.0.norm_out.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 17 | layers.0.norm_out.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 18 | layers.1.norm_feed_forward1.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 19 | layers.1.norm_feed_forward1.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 20 | layers.1.norm_conv.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 21 | layers.1.norm_conv.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 22 | layers.1.norm_self_att.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 23 | layers.1.norm_self_att.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 24 | layers.1.self_attn.pos_bias_u | [8, 128] | FLOAT | 4,096 | 32.0 |
| 25 | layers.1.self_attn.pos_bias_v | [8, 128] | FLOAT | 4,096 | 32.0 |
| 26 | layers.1.norm_feed_forward2.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 27 | layers.1.norm_feed_forward2.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 28 | layers.1.norm_out.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 29 | layers.1.norm_out.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 30 | layers.2.norm_feed_forward1.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 31 | layers.2.norm_feed_forward1.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 32 | layers.2.norm_conv.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 33 | layers.2.norm_conv.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 34 | layers.2.norm_self_att.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 35 | layers.2.norm_self_att.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 36 | layers.2.self_attn.pos_bias_u | [8, 128] | FLOAT | 4,096 | 32.0 |
| 37 | layers.2.self_attn.pos_bias_v | [8, 128] | FLOAT | 4,096 | 32.0 |
| 38 | layers.2.norm_feed_forward2.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 39 | layers.2.norm_feed_forward2.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 40 | layers.2.norm_out.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 41 | layers.2.norm_out.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 42 | layers.3.norm_feed_forward1.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 43 | layers.3.norm_feed_forward1.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 44 | layers.3.norm_conv.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 45 | layers.3.norm_conv.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 46 | layers.3.norm_self_att.weight | [1024] | FLOAT | 4,096 | 32.0 |
| 47 | layers.3.norm_self_att.bias | [1024] | FLOAT | 4,096 | 32.0 |
| 48 | layers.3.self_attn.pos_bias_u | [8, 128] | FLOAT | 4,096 | 32.0 |
| 49 | layers.3.self_attn.pos_bias_v | [8, 128] | FLOAT | 4,096 | 32.0 |
{
"compatibility": [
{
"arch": true,
"context": "opset 17 (requires ORT \u2265 1.14)",
"conversion_possible": true,
"direct_supported": true,
"notes": "ONNX Runtime (CPU/CUDA/DirectML/OpenVINO backends); requires ORT \u2265 1.14",
"quant": null,
"runtime": "ONNX Runtime",
"verification_required": false
},
{
"arch": null,
"context": "opset 17; dynamic batch: needs profiles",
"conversion_possible": true,
"direct_supported": false,
"notes": "Engine build required (trtexec / TRT Python API) | dynamic batch requires explicit optimization profiles (min/opt/max shapes)",
"quant": null,
"runtime": "TensorRT",
"verification_required": true
},
{
"arch": null,
"context": "opset 17; conversion required",
"conversion_possible": true,
"direct_supported": false,
"notes": "Conversion via Model Optimizer (mo) or OpenVINO OVC (openvino.convert_model) required | Op coverage varies; validate with mo --input_model before deployment | dynamic shapes supported but may require --input re-specification",
"quant": null,
"runtime": "OpenVINO",
"verification_required": true
},
{
"arch": null,
"context": "opset 17; conversion via coremltools; opset out of range",
"conversion_possible": false,
"direct_supported": false,
"notes": "Conversion path via coremltools.converters.onnx.convert() \u2014 CoreML is not a direct ONNX runtime; the model must be converted to .mlpackage first. opset 17 exceeds CoreML converter limit (\u2264 16). ",
"quant": null,
"runtime": "CoreML (Apple)",
"verification_required": true
},
{
"arch": null,
"context": null,
"conversion_possible": false,
"direct_supported": false,
"not_supported_msg": "ONNX not supported \u2014 requires GGUF format",
"notes": "GGUF format only; convert with llama.cpp convert scripts",
"quant": false,
"runtime": "llama.cpp / Ollama",
"verification_required": false
}
],
"format": "LLM-SCAN",
"format_version": "1.0",
"generator": {
"name": "llmscan-engine",
"version": "2.0.0"
},
"model": {
"arch": null,
"custom_domains": [],
"declared_weight_bytes": 609822622,
"declared_weight_mb": 581.57,
"domain": "",
"dtype_hist": {
"FLOAT": 322086,
"INT64": 92,
"UINT8": 608533542
},
"dtype_stats": {
"FLOAT": {
"avg_bits_per_elem": 32.0,
"bytes": 1288344,
"count": 612,
"mb": 1.23
},
"INT64": {
"avg_bits_per_elem": 64.0,
"bytes": 736,
"count": 29,
"mb": 0.0
},
"UINT8": {
"avg_bits_per_elem": 8.0,
"bytes": 608533542,
"count": 588,
"mb": 580.34
}
},
"external_refs": [],
"file_size_bytes": 652183999,
"file_size_mb": 621.97,
"format": "onnx",
"has_external_data": false,
"initialized_tensors": 1229,
"inputs": [
{
"dtype": "FLOAT",
"name": "audio_signal",
"shape": [
"audio_signal_dynamic_axes_1",
128,
"audio_signal_dynamic_axes_2"
]
},
{
"dtype": "INT64",
"name": "length",
"shape": [
"length_dynamic_axes_1"
]
}
],
"ir_version": 8,
"kv_meta": {},
"model_type": "audio-speech",
"nodes": 5654,
"op_hist_top": {
"Add": 205,
"And": 2,
"Cast": 426,
"Concat": 221,
"Constant": 1661,
"ConstantOfShape": 51,
"ConvInteger": 77,
"Div": 27,
"DynamicQuantizeLinear": 223,
"Expand": 2,
"Floor": 3,
"Gather": 149,
"LayerNormalization": 120,
"MatMul": 72,
"MatMulInteger": 217,
"Mul": 733,
"Not": 2,
"Pad": 48,
"Relu": 3,
"Reshape": 295,
"Shape": 175,
"Sigmoid": 96,
"Slice": 123,
"Softmax": 24,
"Split": 24,
"Squeeze": 24,
"Sub": 2,
"Transpose": 244,
"Unsqueeze": 328,
"Where": 73
},
"opsets": {
"ai.onnx": 17
},
"outputs": [
{
"dtype": "FLOAT",
"name": "outputs",
"shape": [
"Transposeoutputs_dim_0",
1024,
"Transposeoutputs_dim_2"
]
},
{
"dtype": "INT64",
"name": "encoded_lengths",
"shape": [
"length_dynamic_axes_1"
]
}
],
"params_estimate": 608855720,
"producer": "onnx.quantize",
"quantization": null,
"quantized": false,
"scanner_model_info": {
"custom_domain_detail": {},
"custom_domains": [],
"custom_ops_report": {
"domains": [],
"has_non_standard": false,
"standard_only": true
},
"declared_weight_bytes": 609822622,
"declared_weight_mb": 581.57,
"doc_string": null,
"domain": "",
"dtype_histogram": {
"FLOAT": 322086,
"INT64": 92,
"UINT8": 608533542
},
"dtype_stats": {
"FLOAT": {
"avg_bits_per_elem": 32.0,
"bytes": 1288344,
"count": 612,
"mb": 1.23
},
"INT64": {
"avg_bits_per_elem": 64.0,
"bytes": 736,
"count": 29,
"mb": 0.0
},
"UINT8": {
"avg_bits_per_elem": 8.0,
"bytes": 608533542,
"count": 588,
"mb": 580.34
}
},
"external_data_checks": {
"absolute_paths": [],
"duplicate_files": [],
"missing_files": [],
"null_byte_paths": [],
"oob_reads": [],
"present": false,
"remote_url_paths": [],
"size_validated_count": 0,
"size_validation_total": 0,
"tensor_count": 0,
"traversal_detected": [],
"windows_drive_paths": []
},
"external_refs": [],
"extreme_dim_tensors": 0,
"file_size_bytes": 652183999,
"file_size_mb": 621.97,
"has_external_data": false,
"initializer_integrity": {
"count": 1229,
"duplicate_name_list": [],
"duplicate_names": 0,
"empty_initializers": 0,
"inline_tensor_mismatches": 0,
"nan_inf_scan": {
"affected_tensors": [],
"inf_count": 0,
"method": "full",
"nan_count": 0,
"performed": true,
"tensors_scanned": 318,
"total_float_tensors": 318,
"values_scanned": 321792
},
"shadowing_graph_inputs": 0,
"shadowing_names": [],
"unused_by_graph": 0,
"unused_names": []
},
"inline_tensor_mismatches": 0,
"inputs": [
{
"dtype": "FLOAT",
"name": "audio_signal",
"shape": [
"audio_signal_dynamic_axes_1",
128,
"audio_signal_dynamic_axes_2"
]
},
{
"dtype": "INT64",
"name": "length",
"shape": [
"length_dynamic_axes_1"
]
}
],
"ir_version": 8,
"metadata_props": {
"onnx.infer": "onnxruntime.quant"
},
"model_type": "audio-speech",
"model_version": 0,
"node_count": 5654,
"op_histogram": {
"Add": 205,
"And": 2,
"Cast": 426,
"Concat": 221,
"Constant": 1661,
"ConstantOfShape": 51,
"ConvInteger": 77,
"Div": 27,
"DynamicQuantizeLinear": 223,
"Expand": 2,
"Floor": 3,
"Gather": 149,
"LayerNormalization": 120,
"MatMul": 72,
"MatMulInteger": 217,
"Mul": 733,
"Not": 2,
"Pad": 48,
"Relu": 3,
"Reshape": 295,
"Shape": 175,
"Sigmoid": 96,
"Slice": 123,
"Softmax": 24,
"Split": 24,
"Squeeze": 24,
"Sub": 2,
"Transpose": 244,
"Unsqueeze": 328,
"Where": 73
},
"op_histogram_full": {
"Add": 205,
"And": 2,
"Cast": 426,
"Concat": 221,
"Constant": 1661,
"ConstantOfShape": 51,
"ConvInteger": 77,
"Div": 27,
"DynamicQuantizeLinear": 223,
"Equal": 1,
"Expand": 2,
"Floor": 3,
"Gather": 149,
"LayerNormalization": 120,
"Less": 1,
"MatMul": 72,
"MatMulInteger": 217,
"Mul": 733,
"Not": 2,
"Pad": 48,
"Range": 1,
"Relu": 3,
"Reshape": 295,
"Shape": 175,
"Sigmoid": 96,
"Slice": 123,
"Softmax": 24,
"Split": 24,
"Squeeze": 24,
"Sub": 2,
"Tile": 1,
"Transpose": 244,
"Unsqueeze": 328,
"Where": 73
},
"op_risk_report": {
"elevated_categories": [
"memory_amp",
"runtime_sensitive",
"quantized"
],
"has_control_flow": false,
"has_memory_amp": true,
"has_nondeterministic": false,
"has_provider_compat": false,
"has_quantized": true,
"has_runtime_sensitive": true,
"has_string_ops": false,
"rows": [
{
"count": 51,
"note": "Memory amplification \u2014 allocates tensor of declared shape",
"op": "ConstantOfShape",
"risk": "memory_amp"
},
{
"count": 2,
"note": "Memory amplification \u2014 broadcasts to declared shape",
"op": "Expand",
"risk": "memory_amp"
},
{
"count": 1,
"note": "Memory amplification \u2014 replicates input N times",
"op": "Tile",
"risk": "memory_amp"
},
{
"count": 149,
"note": "Runtime-sensitive \u2014 index-based gather",
"op": "Gather",
"risk": "runtime_sensitive"
},
{
"count": 217,
"note": "Quantized model \u2014 integer matmul",
"op": "MatMulInteger",
"risk": "quantized"
},
{
"count": 77,
"note": "Quantized model \u2014 integer convolution",
"op": "ConvInteger",
"risk": "quantized"
},
{
"count": 1661,
"note": "Standard ONNX op",
"op": "Constant",
"risk": "normal"
},
{
"count": 733,
"note": "Standard ONNX op",
"op": "Mul",
"risk": "normal"
},
{
"count": 426,
"note": "Standard ONNX op",
"op": "Cast",
"risk": "normal"
},
{
"count": 328,
"note": "Standard ONNX op",
"op": "Unsqueeze",
"risk": "normal"
},
{
"count": 295,
"note": "Standard ONNX op",
"op": "Reshape",
"risk": "normal"
},
{
"count": 244,
"note": "Standard ONNX op",
"op": "Transpose",
"risk": "normal"
},
{
"count": 223,
"note": "Standard ONNX op",
"op": "DynamicQuantizeLinear",
"risk": "normal"
},
{
"count": 221,
"note": "Standard ONNX op",
"op": "Concat",
"risk": "normal"
},
{
"count": 205,
"note": "Standard ONNX op",
"op": "Add",
"risk": "normal"
},
{
"count": 175,
"note": "Standard ONNX op",
"op": "Shape",
"risk": "normal"
},
{
"count": 123,
"note": "Standard ONNX op",
"op": "Slice",
"risk": "normal"
},
{
"count": 120,
"note": "Standard ONNX op",
"op": "LayerNormalization",
"risk": "normal"
},
{
"count": 96,
"note": "Standard ONNX op",
"op": "Sigmoid",
"risk": "normal"
},
{
"count": 73,
"note": "Standard ONNX op",
"op": "Where",
"risk": "normal"
},
{
"count": 72,
"note": "Standard ONNX op",
"op": "MatMul",
"risk": "normal"
},
{
"count": 48,
"note": "Standard ONNX op",
"op": "Pad",
"risk": "normal"
},
{
"count": 27,
"note": "Standard ONNX op",
"op": "Div",
"risk": "normal"
},
{
"count": 24,
"note": "Standard ONNX op",
"op": "Squeeze",
"risk": "normal"
},
{
"count": 24,
"note": "Standard ONNX op",
"op": "Softmax",
"risk": "normal"
},
{
"count": 24,
"note": "Standard ONNX op",
"op": "Split",
"risk": "normal"
},
{
"count": 3,
"note": "Standard ONNX op",
"op": "Floor",
"risk": "normal"
},
{
"count": 3,
"note": "Standard ONNX op",
"op": "Relu",
"risk": "normal"
},
{
"count": 2,
"note": "Standard ONNX op",
"op": "Sub",
"risk": "normal"
},
{
"count": 2,
"note": "Standard ONNX op",
"op": "Not",
"risk": "normal"
},
{
"count": 2,
"note": "Standard ONNX op",
"op": "And",
"risk": "normal"
},
{
"count": 1,
"note": "Standard ONNX op",
"op": "Equal",
"risk": "normal"
},
{
"count": 1,
"note": "Standard ONNX op",
"op": "Range",
"risk": "normal"
},
{
"count": 1,
"note": "Standard ONNX op",
"op": "Less",
"risk": "normal"
}
]
},
"opsets": {
"ai.onnx": 17
},
"outputs": [
{
"dtype": "FLOAT",
"name": "outputs",
"shape": [
"Transposeoutputs_dim_0",
1024,
"Transposeoutputs_dim_2"
]
},
{
"dtype": "INT64",
"name": "encoded_lengths",
"shape": [
"length_dynamic_axes_1"
]
}
],
"param_estimate": 608855720,
"producer_name": "onnx.quantize",
"producer_version": "0.1.0",
"quantized": false,
"sha256": "6139d2fa7e1b086097b277c7149725edbab89cc7c7ae64b23c741be4055aff09",
"sha512": "90d6b7163914efd49ad006071282404b788911b2b26f8a5fe70407f193bbce2194a90a92c9f63cec9b7c810146889deb443ffdaf9eb9b0a1cd5b592023ab6be5",
"shape_risk_report": {
"amplification_ratio": 7.95,
"any_dynamic_dims": true,
"dynamic_dim_names": [
"Transposeoutputs_dim_0",
"Transposeoutputs_dim_2",
"audio_signal_dynamic_axes_1",
"audio_signal_dynamic_axes_2",
"length_dynamic_axes_1"
],
"extreme_dims_detected": false,
"input_elements_est": 129,
"inputs": [
{
"dtype": "FLOAT",
"est_elements": 128,
"has_dynamic": true,
"has_negative": false,
"name": "audio_signal",
"shape": [
"audio_signal_dynamic_axes_1",
128,
"audio_signal_dynamic_axes_2"
]
},
{
"dtype": "INT64",
"est_elements": 1,
"has_dynamic": true,
"has_negative": false,
"name": "length",
"shape": [
"length_dynamic_axes_1"
]
}
],
"negative_dims_detected": false,
"output_elements_est": 1025,
"outputs": [
{
"dtype": "FLOAT",
"est_elements": 1024,
"has_dynamic": true,
"has_negative": false,
"name": "outputs",
"shape": [
"Transposeoutputs_dim_0",
1024,
"Transposeoutputs_dim_2"
]
},
{
"dtype": "INT64",
"est_elements": 1,
"has_dynamic": true,
"has_negative": false,
"name": "encoded_lengths",
"shape": [
"length_dynamic_axes_1"
]
}
]
},
"tensor_count": 1229,
"tensor_preview": [
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 0,
"name": "pre_encode.out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 1,
"name": "pre_encode.conv.0.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 2,
"name": "pre_encode.conv.2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 3,
"name": "pre_encode.conv.3.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 4,
"name": "pre_encode.conv.5.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 5,
"name": "pre_encode.conv.6.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 6,
"name": "layers.0.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 7,
"name": "layers.0.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 8,
"name": "layers.0.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 9,
"name": "layers.0.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 10,
"name": "layers.0.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 11,
"name": "layers.0.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 12,
"name": "layers.0.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 13,
"name": "layers.0.self_attn.pos_bias_v"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 14,
"name": "layers.0.norm_feed_forward2.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 15,
"name": "layers.0.norm_feed_forward2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 16,
"name": "layers.0.norm_out.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 17,
"name": "layers.0.norm_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 18,
"name": "layers.1.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 19,
"name": "layers.1.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 20,
"name": "layers.1.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 21,
"name": "layers.1.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 22,
"name": "layers.1.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 23,
"name": "layers.1.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 24,
"name": "layers.1.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 25,
"name": "layers.1.self_attn.pos_bias_v"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 26,
"name": "layers.1.norm_feed_forward2.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 27,
"name": "layers.1.norm_feed_forward2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 28,
"name": "layers.1.norm_out.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 29,
"name": "layers.1.norm_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 30,
"name": "layers.2.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 31,
"name": "layers.2.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 32,
"name": "layers.2.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 33,
"name": "layers.2.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 34,
"name": "layers.2.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 35,
"name": "layers.2.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 36,
"name": "layers.2.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 37,
"name": "layers.2.self_attn.pos_bias_v"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 38,
"name": "layers.2.norm_feed_forward2.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 39,
"name": "layers.2.norm_feed_forward2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 40,
"name": "layers.2.norm_out.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 41,
"name": "layers.2.norm_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 42,
"name": "layers.3.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 43,
"name": "layers.3.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 44,
"name": "layers.3.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 45,
"name": "layers.3.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 46,
"name": "layers.3.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 47,
"name": "layers.3.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 48,
"name": "layers.3.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 49,
"name": "layers.3.self_attn.pos_bias_v"
}
],
"unique_op_types": 34,
"weight_delta_bytes": 42361377,
"weight_delta_mb": 40.4,
"weights_size_bytes": 609822622,
"weights_size_mb": 581.57,
"zero_dim_initializers": 0
},
"sha256": "6139d2fa7e1b086097b277c7149725edbab89cc7c7ae64b23c741be4055aff09",
"sha512": "90d6b7163914efd49ad006071282404b788911b2b26f8a5fe70407f193bbce2194a90a92c9f63cec9b7c810146889deb443ffdaf9eb9b0a1cd5b592023ab6be5",
"tensor_preview": [
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 0,
"name": "pre_encode.out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 1,
"name": "pre_encode.conv.0.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 2,
"name": "pre_encode.conv.2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 3,
"name": "pre_encode.conv.3.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 4,
"name": "pre_encode.conv.5.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 5,
"name": "pre_encode.conv.6.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 6,
"name": "layers.0.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 7,
"name": "layers.0.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 8,
"name": "layers.0.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 9,
"name": "layers.0.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 10,
"name": "layers.0.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 11,
"name": "layers.0.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 12,
"name": "layers.0.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 13,
"name": "layers.0.self_attn.pos_bias_v"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 14,
"name": "layers.0.norm_feed_forward2.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 15,
"name": "layers.0.norm_feed_forward2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 16,
"name": "layers.0.norm_out.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 17,
"name": "layers.0.norm_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 18,
"name": "layers.1.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 19,
"name": "layers.1.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 20,
"name": "layers.1.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 21,
"name": "layers.1.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 22,
"name": "layers.1.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 23,
"name": "layers.1.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 24,
"name": "layers.1.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 25,
"name": "layers.1.self_attn.pos_bias_v"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 26,
"name": "layers.1.norm_feed_forward2.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 27,
"name": "layers.1.norm_feed_forward2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 28,
"name": "layers.1.norm_out.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 29,
"name": "layers.1.norm_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 30,
"name": "layers.2.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 31,
"name": "layers.2.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 32,
"name": "layers.2.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 33,
"name": "layers.2.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 34,
"name": "layers.2.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 35,
"name": "layers.2.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 36,
"name": "layers.2.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 37,
"name": "layers.2.self_attn.pos_bias_v"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 38,
"name": "layers.2.norm_feed_forward2.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 39,
"name": "layers.2.norm_feed_forward2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 40,
"name": "layers.2.norm_out.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 41,
"name": "layers.2.norm_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 42,
"name": "layers.3.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 43,
"name": "layers.3.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 44,
"name": "layers.3.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 45,
"name": "layers.3.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 46,
"name": "layers.3.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 47,
"name": "layers.3.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 48,
"name": "layers.3.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 49,
"name": "layers.3.self_attn.pos_bias_v"
}
],
"weight_delta_mb": 40.4,
"weights_size_est_bytes": 609822622
},
"report": {
"bullets": [
"ONNX audio-speech model | opset 17 | 5654 nodes | 608,855,720 params | 3 warnings / 5 informational",
"Size: 621.97 MB",
"SHA256: 6139d2fa7e1b0860..."
],
"recommendations": [
"Add a license field during export (e.g. apache-2.0, mit, cc-by-4.0)",
"Set author and domain fields during model export",
"Enforce maximum input shape at the serving layer (e.g. ORT session options, preprocessing validation). Document accepted input bounds in model card."
],
"summary": "ONNX audio-speech model | opset 17 | 5654 nodes | 608,855,720 params | 3 warnings / 5 informational"
},
"scan_context": {
"duration_ms": 3549,
"ended_at": "2026-08-05T12:17:14+00:00Z",
"limits": {
"sandbox": true,
"timeout_ms": 60000
},
"mode": "static-deep",
"started_at": "2026-08-05T12:17:14+00:00Z"
},
"security": {
"findings": [
{
"category": "Shape Risk",
"detail": "Inputs with dynamic dims: [\u0027audio_signal\u0027, \u0027length\u0027]. Outputs: [\u0027outputs\u0027, \u0027encoded_lengths\u0027] (symbolic: Transposeoutputs_dim_0, Transposeoutputs_dim_2, audio_signal_dynamic_axes_1, audio_signal_dynamic_axes_2). Dynamic dims allow flexible batch sizes and sequence lengths, but without enforced bounds a caller can supply arbitrarily large tensors causing OOM. This is expected for most inference models.",
"recommendation": "Enforce maximum input shape at the serving layer (e.g. ORT SessionOptions.add_session_config_entry, preprocessing validation). Document accepted input bounds in model card or deployment README.",
"severity": "INFO",
"title": "Dynamic tensor dimensions detected"
},
{
"category": "Supply Chain",
"detail": "Models without license information cannot be safely redistributed or deployed commercially. ONNX metadata supports a license property in model.metadata_props.",
"recommendation": "Add a license field during export (e.g. apache-2.0, mit, cc-by-4.0)",
"severity": "LOW",
"title": "No license field in ONNX model metadata"
},
{
"category": "Supply Chain",
"detail": "Neither author nor domain (producer namespace) are set. Without origin information the model cannot be traced to a trusted source.",
"recommendation": "Set author and domain fields during model export",
"severity": "LOW",
"title": "No provenance metadata in ONNX model"
},
{
"category": "Resources",
"detail": "This model has 5,654 nodes, 1229 initializers, 608,855,720 parameters, and 609.8 MB of declared weights. Larger graphs have higher memory allocation overhead at load time and may hit per-request limits in serving frameworks.",
"recommendation": "Validate memory and latency under representative maximum input length. Set request concurrency and input-size limits before exposing the model as a service.",
"severity": "INFO",
"title": "Large ONNX graph \u2014 5,654 graph nodes / ~609M parameters"
},
{
"category": "Provenance",
"detail": "Producer metadata helps identify the tool that exported this model",
"recommendation": "Verify producer matches expected export pipeline",
"severity": "INFO",
"title": "Model producer: onnx.quantize 0.1.0"
},
{
"category": "Classification",
"detail": "Based on op inventory (5654 total nodes, 34 unique types)",
"recommendation": "Verify this matches the model\u0027s intended use case",
"severity": "INFO",
"title": "Inferred model type: audio-speech"
},
{
"category": "Runtime",
"detail": "Opset governs which ops and behaviors are available at runtime",
"recommendation": "Use ONNX Runtime (CPU/CUDA/DirectML/OpenVINO backends); requires ORT \u2265 1.14",
"severity": "INFO",
"title": "Default opset: 17"
},
{
"category": "Runtime Safety",
"detail": "Inputs with all-dynamic dimensions: [(\u0027length\u0027, \"[\u0027length_dynamic_axes_1\u0027]\")]. Without static bounds, a malicious caller can supply arbitrarily large tensors causing OOM. The model itself is not malicious, but deployments must enforce input size limits.",
"recommendation": "Enforce maximum input shape at the serving layer (e.g. ORT session options, preprocessing validation). Document accepted input bounds in model card.",
"severity": "LOW",
"title": "Fully dynamic input shapes (1 input(s))"
}
],
"grade": "B",
"score": 91
},
"source": {
"filename": "encoder-model.int8.onnx",
"hashes": {
"sha256": "6139d2fa7e1b086097b277c7149725edbab89cc7c7ae64b23c741be4055aff09"
},
"input_type": "file",
"size_bytes": 652183999
},
"tensors": {
"count": 1229,
"dtype_histogram": {
"FLOAT": 322086,
"INT64": 92,
"UINT8": 608533542
},
"dtype_stats": {
"FLOAT": {
"avg_bits_per_elem": 32.0,
"bytes": 1288344,
"count": 612,
"mb": 1.23
},
"INT64": {
"avg_bits_per_elem": 64.0,
"bytes": 736,
"count": 29,
"mb": 0.0
},
"UINT8": {
"avg_bits_per_elem": 8.0,
"bytes": 608533542,
"count": 588,
"mb": 580.34
}
},
"integrity": {
"declared_weight_bytes": 609822622,
"external_refs": [],
"has_external_data": false,
"weight_delta_mb": 40.4,
"weights_size_est_bytes": 609822622
},
"preview": [
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 0,
"name": "pre_encode.out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 1,
"name": "pre_encode.conv.0.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 2,
"name": "pre_encode.conv.2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 3,
"name": "pre_encode.conv.3.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 4,
"name": "pre_encode.conv.5.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 1024,
"dims": [
256
],
"dtype_name": "FLOAT",
"index": 5,
"name": "pre_encode.conv.6.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 6,
"name": "layers.0.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 7,
"name": "layers.0.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 8,
"name": "layers.0.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 9,
"name": "layers.0.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 10,
"name": "layers.0.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 11,
"name": "layers.0.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 12,
"name": "layers.0.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 13,
"name": "layers.0.self_attn.pos_bias_v"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 14,
"name": "layers.0.norm_feed_forward2.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 15,
"name": "layers.0.norm_feed_forward2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 16,
"name": "layers.0.norm_out.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 17,
"name": "layers.0.norm_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 18,
"name": "layers.1.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 19,
"name": "layers.1.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 20,
"name": "layers.1.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 21,
"name": "layers.1.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 22,
"name": "layers.1.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 23,
"name": "layers.1.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 24,
"name": "layers.1.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 25,
"name": "layers.1.self_attn.pos_bias_v"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 26,
"name": "layers.1.norm_feed_forward2.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 27,
"name": "layers.1.norm_feed_forward2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 28,
"name": "layers.1.norm_out.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 29,
"name": "layers.1.norm_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 30,
"name": "layers.2.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 31,
"name": "layers.2.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 32,
"name": "layers.2.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 33,
"name": "layers.2.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 34,
"name": "layers.2.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 35,
"name": "layers.2.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 36,
"name": "layers.2.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 37,
"name": "layers.2.self_attn.pos_bias_v"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 38,
"name": "layers.2.norm_feed_forward2.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 39,
"name": "layers.2.norm_feed_forward2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 40,
"name": "layers.2.norm_out.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 41,
"name": "layers.2.norm_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 42,
"name": "layers.3.norm_feed_forward1.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 43,
"name": "layers.3.norm_feed_forward1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 44,
"name": "layers.3.norm_conv.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 45,
"name": "layers.3.norm_conv.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 46,
"name": "layers.3.norm_self_att.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
1024
],
"dtype_name": "FLOAT",
"index": 47,
"name": "layers.3.norm_self_att.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 48,
"name": "layers.3.self_attn.pos_bias_u"
},
{
"bits_per_elem": 32.0,
"byte_len": 4096,
"dims": [
8,
128
],
"dtype_name": "FLOAT",
"index": 49,
"name": "layers.3.self_attn.pos_bias_v"
}
]
},
"tokenizer": {}
}