| Base score | 100 |
| LOW No license field in ONNX model metadata | -3 |
| LOW No provenance metadata in ONNX model | -3 |
| Penalty subtotal | 94/100 |
| Final | A / 94 |
| Runtime | Status | Quant | Architecture | Context |
|---|---|---|---|---|
| ONNX Runtime |
✓
Direct
|
? | ✓ | opset 17 (requires ORT ≥ 1.14) |
|
TensorRT
Verify arch support
|
⚡
Via conversion
verify required
|
? | ? verify |
opset 17 |
|
OpenVINO
Verify arch support
|
⚡
Via conversion
verify required
|
? | ? verify |
opset 17; conversion required |
|
CoreML (Apple)
Verify arch support
|
✗
Not possible
|
? | ? verify |
opset 17; conversion via coremltools; opset out of range |
| llama.cpp / Ollama | ✗ | N/A | ONNX not supported — requires GGUF format | |
| Parameters ~ Estimated total number of weight values; determines VRAM needed at inference | 233,990,207 |
| Tensors Total number of weight tensors stored in the file | 916 |
| File size Size on disk in megabytes | 893.76 MB |
| Graph nodes Total number of computational nodes in the ONNX graph | 7496 |
| Opsets ONNX operator set versions declared by the model | {"ai.onnx": 17} |
| Producer Tool or framework that exported this ONNX model | pytorch |
| SHA-256 | b1145eb7e9d2dbb9005fc99ed0313efebfadffea4aee1f4fa68b69a359126227 |
| SHA-512 | 277a42c8b1dc47f55df706d9b5bf51b43324b792c628cdb149103d9145cd773173b0eb1eecb34952… |
| File size | 937,179,517 bytes (893.76 MB) |
| Declared weight bytes | 935,960,828 (892.6 MB) |
| Non-weight overhead | 1.16 MB |
| Initializers (weights) | 916 |
| Graph nodes | 7496 |
ai.onnx or ai.onnx.ml domain. No custom kernels, no vendor-specific ops.| Domain | Type | Ops | Runtime requirement |
|---|---|---|---|
ai.onnx |
Standard | — | None — supported by all ONNX runtimes |
| Check | Count | Status |
|---|---|---|
| Inline tensor byte-size mismatches raw_data length vs declared shape × dtype_bytes |
0 | ✓ PASS |
| Empty initializers Non-zero shape declared but no inline or external data |
0 | ✓ PASS |
| Duplicate initializer names ONNX spec requires unique names; duplicates cause non-deterministic behaviour |
0 | ✓ PASS |
| Initializers not used by graph Present in graph.initializer but not referenced by any node input |
0 | ✓ PASS |
| Graph inputs shadowing initializers Per ONNX spec these become optional overridable weights; runtime behaviour varies |
0 | ✓ PASS |
| NaN / Inf numeric scan
Sampled scan — 14,937,359 values across 916 / 916 float tensor(s)
|
0 | ✓ PASS (sampled) |
| Risk category | Operators in this model |
|---|---|
|
▪ Control-flow ops
Loop, If, Scan — conditional/recursive execution
|
none |
|
⚠ Memory amplification
ConstantOfShape, Expand, Tile — size from runtime shapes
|
ConstantOfShape ×70
|
|
▪ Provider compat
NMS, RoiAlign, GridSample — not in all runtimes
|
none |
|
⚠ Runtime-sensitive ops
Scatter, Gather, Resize — edge-case differences
|
Gather ×563
|
|
▪ Quantized ops
QuantizeLinear, QLinearConv — quantized path required
|
none |
|
▪ Non-deterministic ops
Random*, Multinomial — output varies between runs
|
none |
|
▪ String processing ops
Tokenizer, TfIdfVectorizer — unusual in weight models
|
none |
|
▪ Custom ops / domains
Non-standard op domains — may execute arbitrary native code
|
none |
| Op | Count | Risk |
|---|---|---|
| ConstantOfShape | 70 | Memory amplification — allocates tensor of declared shape |
| Gather | 563 | Runtime-sensitive — index-based gather |
| Constant | 2405 | — |
| Add | 632 | — |
| Unsqueeze | 566 | — |
| Shape | 563 | — |
| Transpose | 490 | — |
| Reshape | 423 | — |
| MatMul | 421 | — |
| Concat | 352 | — |
| Cast | 222 | — |
| Mul | 214 | — |
| LayerNormalization | 142 | — |
| Split | 70 | — |
| Slice | 70 | — |
| Pad | 70 | — |
| Conv | 70 | — |
| Softmax | 70 | — |
| Relu | 70 | — |
| Range | 3 | — |
| Sub | 2 | — |
| Div | 2 | — |
| ReduceMax | 1 | — |
| Less | 1 | — |
| Neg | 1 | — |
| Exp | 1 | — |
| Sin | 1 | — |
| Cos | 1 | — |
| Name | Dtype | Shape | Est. elements |
|---|---|---|---|
| speech | FLOAT | [1, speech_length, 560] | 560 |
| speech_lengths | INT64 | [1] | 1 |
| Name | Dtype | Shape | Est. elements |
|---|---|---|---|
| encoder_out | FLOAT | [Addencoder_out_dim_0, encoder_out_length, 25055] | 25,055 |
| Check | Result |
|---|---|
| External data present Whether any weight tensors are stored outside the .onnx file |
✓ PASS
|
| Absolute paths Paths starting with / or C:\ escape the model directory |
N/A |
| Path traversal (../) .. sequences that could read files outside the model directory |
N/A |
| Windows drive paths (C:\) Drive-letter paths are always absolute and OS-specific |
N/A |
| Remote / URL paths http://, ftp:// etc. would trigger network requests at load time |
N/A |
| Null bytes in paths Null-byte injection truncates paths in C/C++ runtimes |
N/A |
| Duplicate file references Same external file referenced by multiple tensors |
N/A |
| Missing external files Referenced files not present on disk at scan time |
N/A |
| Out-of-bounds reads offset + length exceeds the external file size |
N/A |
| Offset/length range validated Verified that each tensor's offset+length fits within the external file | N/A |
| DType | Count | Total bytes | Total MB | Avg bits/elem |
|---|---|---|---|---|
| FLOAT | 916 | 935,960,828 | 892.6 | 32.0 |
| # | Name | Shape | DType | Bytes | bits/elem |
|---|---|---|---|---|---|
| 0 | model.encoders0.self_attn.linear_out.bias | [512] | FLOAT | 2,048 | 32.0 |
| 1 | model.encoders0.self_attn.linear_q_k_v.bias | [1536] | FLOAT | 6,144 | 32.0 |
| 2 | model.encoders0.self_attn.fsmn_block.weight | [512, 1, 11] | FLOAT | 22,528 | 32.0 |
| 3 | model.encoders0.feed_forward.w_1.bias | [2048] | FLOAT | 8,192 | 32.0 |
| 4 | model.encoders0.feed_forward.w_2.bias | [512] | FLOAT | 2,048 | 32.0 |
| 5 | model.encoders.0.self_attn.linear_out.bias | [512] | FLOAT | 2,048 | 32.0 |
| 6 | model.encoders.0.self_attn.linear_q_k_v.bias | [1536] | FLOAT | 6,144 | 32.0 |
| 7 | model.encoders.0.self_attn.fsmn_block.weight | [512, 1, 11] | FLOAT | 22,528 | 32.0 |
| 8 | model.encoders.0.feed_forward.w_1.bias | [2048] | FLOAT | 8,192 | 32.0 |
| 9 | model.encoders.0.feed_forward.w_2.bias | [512] | FLOAT | 2,048 | 32.0 |
| 10 | model.encoders.1.self_attn.linear_out.bias | [512] | FLOAT | 2,048 | 32.0 |
| 11 | model.encoders.1.self_attn.linear_q_k_v.bias | [1536] | FLOAT | 6,144 | 32.0 |
| 12 | model.encoders.1.self_attn.fsmn_block.weight | [512, 1, 11] | FLOAT | 22,528 | 32.0 |
| 13 | model.encoders.1.feed_forward.w_1.bias | [2048] | FLOAT | 8,192 | 32.0 |
| 14 | model.encoders.1.feed_forward.w_2.bias | [512] | FLOAT | 2,048 | 32.0 |
| 15 | model.encoders.2.self_attn.linear_out.bias | [512] | FLOAT | 2,048 | 32.0 |
| 16 | model.encoders.2.self_attn.linear_q_k_v.bias | [1536] | FLOAT | 6,144 | 32.0 |
| 17 | model.encoders.2.self_attn.fsmn_block.weight | [512, 1, 11] | FLOAT | 22,528 | 32.0 |
| 18 | model.encoders.2.feed_forward.w_1.bias | [2048] | FLOAT | 8,192 | 32.0 |
| 19 | model.encoders.2.feed_forward.w_2.bias | [512] | FLOAT | 2,048 | 32.0 |
| 20 | model.encoders.3.self_attn.linear_out.bias | [512] | FLOAT | 2,048 | 32.0 |
| 21 | model.encoders.3.self_attn.linear_q_k_v.bias | [1536] | FLOAT | 6,144 | 32.0 |
| 22 | model.encoders.3.self_attn.fsmn_block.weight | [512, 1, 11] | FLOAT | 22,528 | 32.0 |
| 23 | model.encoders.3.feed_forward.w_1.bias | [2048] | FLOAT | 8,192 | 32.0 |
| 24 | model.encoders.3.feed_forward.w_2.bias | [512] | FLOAT | 2,048 | 32.0 |
| 25 | model.encoders.4.self_attn.linear_out.bias | [512] | FLOAT | 2,048 | 32.0 |
| 26 | model.encoders.4.self_attn.linear_q_k_v.bias | [1536] | FLOAT | 6,144 | 32.0 |
| 27 | model.encoders.4.self_attn.fsmn_block.weight | [512, 1, 11] | FLOAT | 22,528 | 32.0 |
| 28 | model.encoders.4.feed_forward.w_1.bias | [2048] | FLOAT | 8,192 | 32.0 |
| 29 | model.encoders.4.feed_forward.w_2.bias | [512] | FLOAT | 2,048 | 32.0 |
| 30 | model.encoders.5.self_attn.linear_out.bias | [512] | FLOAT | 2,048 | 32.0 |
| 31 | model.encoders.5.self_attn.linear_q_k_v.bias | [1536] | FLOAT | 6,144 | 32.0 |
| 32 | model.encoders.5.self_attn.fsmn_block.weight | [512, 1, 11] | FLOAT | 22,528 | 32.0 |
| 33 | model.encoders.5.feed_forward.w_1.bias | [2048] | FLOAT | 8,192 | 32.0 |
| 34 | model.encoders.5.feed_forward.w_2.bias | [512] | FLOAT | 2,048 | 32.0 |
| 35 | model.encoders.6.self_attn.linear_out.bias | [512] | FLOAT | 2,048 | 32.0 |
| 36 | model.encoders.6.self_attn.linear_q_k_v.bias | [1536] | FLOAT | 6,144 | 32.0 |
| 37 | model.encoders.6.self_attn.fsmn_block.weight | [512, 1, 11] | FLOAT | 22,528 | 32.0 |
| 38 | model.encoders.6.feed_forward.w_1.bias | [2048] | FLOAT | 8,192 | 32.0 |
| 39 | model.encoders.6.feed_forward.w_2.bias | [512] | FLOAT | 2,048 | 32.0 |
| 40 | model.encoders.7.self_attn.linear_out.bias | [512] | FLOAT | 2,048 | 32.0 |
| 41 | model.encoders.7.self_attn.linear_q_k_v.bias | [1536] | FLOAT | 6,144 | 32.0 |
| 42 | model.encoders.7.self_attn.fsmn_block.weight | [512, 1, 11] | FLOAT | 22,528 | 32.0 |
| 43 | model.encoders.7.feed_forward.w_1.bias | [2048] | FLOAT | 8,192 | 32.0 |
| 44 | model.encoders.7.feed_forward.w_2.bias | [512] | FLOAT | 2,048 | 32.0 |
| 45 | model.encoders.8.self_attn.linear_out.bias | [512] | FLOAT | 2,048 | 32.0 |
| 46 | model.encoders.8.self_attn.linear_q_k_v.bias | [1536] | FLOAT | 6,144 | 32.0 |
| 47 | model.encoders.8.self_attn.fsmn_block.weight | [512, 1, 11] | FLOAT | 22,528 | 32.0 |
| 48 | model.encoders.8.feed_forward.w_1.bias | [2048] | FLOAT | 8,192 | 32.0 |
| 49 | model.encoders.8.feed_forward.w_2.bias | [512] | FLOAT | 2,048 | 32.0 |
{
"compatibility": [
{
"arch": true,
"context": "opset 17 (requires ORT \u2265 1.14)",
"conversion_possible": true,
"direct_supported": true,
"notes": "ONNX Runtime (CPU/CUDA/DirectML/OpenVINO backends); requires ORT \u2265 1.14",
"quant": null,
"runtime": "ONNX Runtime",
"verification_required": false
},
{
"arch": null,
"context": "opset 17",
"conversion_possible": true,
"direct_supported": false,
"notes": "Engine build required (trtexec / TRT Python API)",
"quant": null,
"runtime": "TensorRT",
"verification_required": true
},
{
"arch": null,
"context": "opset 17; conversion required",
"conversion_possible": true,
"direct_supported": false,
"notes": "Conversion via Model Optimizer (mo) or OpenVINO OVC (openvino.convert_model) required | Op coverage varies; validate with mo --input_model before deployment",
"quant": null,
"runtime": "OpenVINO",
"verification_required": true
},
{
"arch": null,
"context": "opset 17; conversion via coremltools; opset out of range",
"conversion_possible": false,
"direct_supported": false,
"notes": "Conversion path via coremltools.converters.onnx.convert() \u2014 CoreML is not a direct ONNX runtime; the model must be converted to .mlpackage first. opset 17 exceeds CoreML converter limit (\u2264 16). ",
"quant": null,
"runtime": "CoreML (Apple)",
"verification_required": true
},
{
"arch": null,
"context": null,
"conversion_possible": false,
"direct_supported": false,
"not_supported_msg": "ONNX not supported \u2014 requires GGUF format",
"notes": "GGUF format only; convert with llama.cpp convert scripts",
"quant": false,
"runtime": "llama.cpp / Ollama",
"verification_required": false
}
],
"format": "LLM-SCAN",
"format_version": "1.0",
"generator": {
"name": "llmscan-engine",
"version": "2.0.0"
},
"model": {
"arch": null,
"custom_domains": [],
"declared_weight_bytes": 935960828,
"declared_weight_mb": 892.6,
"domain": "",
"dtype_hist": {
"FLOAT": 233990207
},
"dtype_stats": {
"FLOAT": {
"avg_bits_per_elem": 32.0,
"bytes": 935960828,
"count": 916,
"mb": 892.6
}
},
"external_refs": [],
"file_size_bytes": 937179517,
"file_size_mb": 893.76,
"format": "onnx",
"has_external_data": false,
"initialized_tensors": 916,
"inputs": [
{
"dtype": "FLOAT",
"name": "speech",
"shape": [
1,
"speech_length",
560
]
},
{
"dtype": "INT64",
"name": "speech_lengths",
"shape": [
1
]
}
],
"ir_version": 8,
"kv_meta": {},
"model_type": "audio-speech",
"nodes": 7496,
"op_hist_top": {
"Add": 632,
"Cast": 222,
"Concat": 352,
"Constant": 2405,
"ConstantOfShape": 70,
"Conv": 70,
"Cos": 1,
"Div": 2,
"Exp": 1,
"Gather": 563,
"LayerNormalization": 142,
"Less": 1,
"MatMul": 421,
"Mul": 214,
"Neg": 1,
"Pad": 70,
"Range": 3,
"ReduceMax": 1,
"Relu": 70,
"Reshape": 423,
"Shape": 563,
"Sin": 1,
"Slice": 70,
"Softmax": 70,
"Split": 70,
"Sub": 2,
"Transpose": 490,
"Unsqueeze": 566
},
"opsets": {
"ai.onnx": 17
},
"outputs": [
{
"dtype": "FLOAT",
"name": "encoder_out",
"shape": [
"Addencoder_out_dim_0",
"encoder_out_length",
25055
]
}
],
"params_estimate": 233990207,
"producer": "pytorch",
"quantization": null,
"quantized": false,
"scanner_model_info": {
"custom_domain_detail": {},
"custom_domains": [],
"custom_ops_report": {
"domains": [],
"has_non_standard": false,
"standard_only": true
},
"declared_weight_bytes": 935960828,
"declared_weight_mb": 892.6,
"doc_string": null,
"domain": "",
"dtype_histogram": {
"FLOAT": 233990207
},
"dtype_stats": {
"FLOAT": {
"avg_bits_per_elem": 32.0,
"bytes": 935960828,
"count": 916,
"mb": 892.6
}
},
"external_data_checks": {
"absolute_paths": [],
"duplicate_files": [],
"missing_files": [],
"null_byte_paths": [],
"oob_reads": [],
"present": false,
"remote_url_paths": [],
"size_validated_count": 0,
"size_validation_total": 0,
"tensor_count": 0,
"traversal_detected": [],
"windows_drive_paths": []
},
"external_refs": [],
"extreme_dim_tensors": 0,
"file_size_bytes": 937179517,
"file_size_mb": 893.76,
"has_external_data": false,
"initializer_integrity": {
"count": 916,
"duplicate_name_list": [],
"duplicate_names": 0,
"empty_initializers": 0,
"inline_tensor_mismatches": 0,
"nan_inf_scan": {
"affected_tensors": [],
"inf_count": 0,
"method": "sampled",
"nan_count": 0,
"performed": true,
"tensors_scanned": 916,
"total_float_tensors": 916,
"values_scanned": 14937359
},
"shadowing_graph_inputs": 0,
"shadowing_names": [],
"unused_by_graph": 0,
"unused_names": []
},
"inline_tensor_mismatches": 0,
"inputs": [
{
"dtype": "FLOAT",
"name": "speech",
"shape": [
1,
"speech_length",
560
]
},
{
"dtype": "INT64",
"name": "speech_lengths",
"shape": [
1
]
}
],
"ir_version": 8,
"metadata_props": {},
"model_type": "audio-speech",
"model_version": 0,
"node_count": 7496,
"op_histogram": {
"Add": 632,
"Cast": 222,
"Concat": 352,
"Constant": 2405,
"ConstantOfShape": 70,
"Conv": 70,
"Cos": 1,
"Div": 2,
"Exp": 1,
"Gather": 563,
"LayerNormalization": 142,
"Less": 1,
"MatMul": 421,
"Mul": 214,
"Neg": 1,
"Pad": 70,
"Range": 3,
"ReduceMax": 1,
"Relu": 70,
"Reshape": 423,
"Shape": 563,
"Sin": 1,
"Slice": 70,
"Softmax": 70,
"Split": 70,
"Sub": 2,
"Transpose": 490,
"Unsqueeze": 566
},
"op_histogram_full": {
"Add": 632,
"Cast": 222,
"Concat": 352,
"Constant": 2405,
"ConstantOfShape": 70,
"Conv": 70,
"Cos": 1,
"Div": 2,
"Exp": 1,
"Gather": 563,
"LayerNormalization": 142,
"Less": 1,
"MatMul": 421,
"Mul": 214,
"Neg": 1,
"Pad": 70,
"Range": 3,
"ReduceMax": 1,
"Relu": 70,
"Reshape": 423,
"Shape": 563,
"Sin": 1,
"Slice": 70,
"Softmax": 70,
"Split": 70,
"Sub": 2,
"Transpose": 490,
"Unsqueeze": 566
},
"op_risk_report": {
"elevated_categories": [
"memory_amp",
"runtime_sensitive"
],
"has_control_flow": false,
"has_memory_amp": true,
"has_nondeterministic": false,
"has_provider_compat": false,
"has_quantized": false,
"has_runtime_sensitive": true,
"has_string_ops": false,
"rows": [
{
"count": 70,
"note": "Memory amplification \u2014 allocates tensor of declared shape",
"op": "ConstantOfShape",
"risk": "memory_amp"
},
{
"count": 563,
"note": "Runtime-sensitive \u2014 index-based gather",
"op": "Gather",
"risk": "runtime_sensitive"
},
{
"count": 2405,
"note": "Standard ONNX op",
"op": "Constant",
"risk": "normal"
},
{
"count": 632,
"note": "Standard ONNX op",
"op": "Add",
"risk": "normal"
},
{
"count": 566,
"note": "Standard ONNX op",
"op": "Unsqueeze",
"risk": "normal"
},
{
"count": 563,
"note": "Standard ONNX op",
"op": "Shape",
"risk": "normal"
},
{
"count": 490,
"note": "Standard ONNX op",
"op": "Transpose",
"risk": "normal"
},
{
"count": 423,
"note": "Standard ONNX op",
"op": "Reshape",
"risk": "normal"
},
{
"count": 421,
"note": "Standard ONNX op",
"op": "MatMul",
"risk": "normal"
},
{
"count": 352,
"note": "Standard ONNX op",
"op": "Concat",
"risk": "normal"
},
{
"count": 222,
"note": "Standard ONNX op",
"op": "Cast",
"risk": "normal"
},
{
"count": 214,
"note": "Standard ONNX op",
"op": "Mul",
"risk": "normal"
},
{
"count": 142,
"note": "Standard ONNX op",
"op": "LayerNormalization",
"risk": "normal"
},
{
"count": 70,
"note": "Standard ONNX op",
"op": "Split",
"risk": "normal"
},
{
"count": 70,
"note": "Standard ONNX op",
"op": "Slice",
"risk": "normal"
},
{
"count": 70,
"note": "Standard ONNX op",
"op": "Pad",
"risk": "normal"
},
{
"count": 70,
"note": "Standard ONNX op",
"op": "Conv",
"risk": "normal"
},
{
"count": 70,
"note": "Standard ONNX op",
"op": "Softmax",
"risk": "normal"
},
{
"count": 70,
"note": "Standard ONNX op",
"op": "Relu",
"risk": "normal"
},
{
"count": 3,
"note": "Standard ONNX op",
"op": "Range",
"risk": "normal"
},
{
"count": 2,
"note": "Standard ONNX op",
"op": "Sub",
"risk": "normal"
},
{
"count": 2,
"note": "Standard ONNX op",
"op": "Div",
"risk": "normal"
},
{
"count": 1,
"note": "Standard ONNX op",
"op": "ReduceMax",
"risk": "normal"
},
{
"count": 1,
"note": "Standard ONNX op",
"op": "Less",
"risk": "normal"
},
{
"count": 1,
"note": "Standard ONNX op",
"op": "Neg",
"risk": "normal"
},
{
"count": 1,
"note": "Standard ONNX op",
"op": "Exp",
"risk": "normal"
},
{
"count": 1,
"note": "Standard ONNX op",
"op": "Sin",
"risk": "normal"
},
{
"count": 1,
"note": "Standard ONNX op",
"op": "Cos",
"risk": "normal"
}
]
},
"opsets": {
"ai.onnx": 17
},
"outputs": [
{
"dtype": "FLOAT",
"name": "encoder_out",
"shape": [
"Addencoder_out_dim_0",
"encoder_out_length",
25055
]
}
],
"param_estimate": 233990207,
"producer_name": "pytorch",
"producer_version": "2.3.0",
"quantized": false,
"sha256": "b1145eb7e9d2dbb9005fc99ed0313efebfadffea4aee1f4fa68b69a359126227",
"sha512": "277a42c8b1dc47f55df706d9b5bf51b43324b792c628cdb149103d9145cd773173b0eb1eecb34952d389a999de2b4d57dc6703b305480b43d8f439885ba0ab70",
"shape_risk_report": {
"amplification_ratio": 44.66,
"any_dynamic_dims": true,
"dynamic_dim_names": [
"Addencoder_out_dim_0",
"encoder_out_length",
"speech_length"
],
"extreme_dims_detected": false,
"input_elements_est": 561,
"inputs": [
{
"dtype": "FLOAT",
"est_elements": 560,
"has_dynamic": true,
"has_negative": false,
"name": "speech",
"shape": [
1,
"speech_length",
560
]
},
{
"dtype": "INT64",
"est_elements": 1,
"has_dynamic": false,
"has_negative": false,
"name": "speech_lengths",
"shape": [
1
]
}
],
"negative_dims_detected": false,
"output_elements_est": 25055,
"outputs": [
{
"dtype": "FLOAT",
"est_elements": 25055,
"has_dynamic": true,
"has_negative": false,
"name": "encoder_out",
"shape": [
"Addencoder_out_dim_0",
"encoder_out_length",
25055
]
}
]
},
"tensor_count": 916,
"tensor_preview": [
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 0,
"name": "model.encoders0.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 1,
"name": "model.encoders0.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 2,
"name": "model.encoders0.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 3,
"name": "model.encoders0.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 4,
"name": "model.encoders0.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 5,
"name": "model.encoders.0.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 6,
"name": "model.encoders.0.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 7,
"name": "model.encoders.0.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 8,
"name": "model.encoders.0.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 9,
"name": "model.encoders.0.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 10,
"name": "model.encoders.1.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 11,
"name": "model.encoders.1.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 12,
"name": "model.encoders.1.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 13,
"name": "model.encoders.1.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 14,
"name": "model.encoders.1.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 15,
"name": "model.encoders.2.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 16,
"name": "model.encoders.2.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 17,
"name": "model.encoders.2.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 18,
"name": "model.encoders.2.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 19,
"name": "model.encoders.2.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 20,
"name": "model.encoders.3.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 21,
"name": "model.encoders.3.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 22,
"name": "model.encoders.3.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 23,
"name": "model.encoders.3.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 24,
"name": "model.encoders.3.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 25,
"name": "model.encoders.4.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 26,
"name": "model.encoders.4.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 27,
"name": "model.encoders.4.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 28,
"name": "model.encoders.4.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 29,
"name": "model.encoders.4.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 30,
"name": "model.encoders.5.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 31,
"name": "model.encoders.5.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 32,
"name": "model.encoders.5.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 33,
"name": "model.encoders.5.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 34,
"name": "model.encoders.5.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 35,
"name": "model.encoders.6.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 36,
"name": "model.encoders.6.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 37,
"name": "model.encoders.6.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 38,
"name": "model.encoders.6.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 39,
"name": "model.encoders.6.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 40,
"name": "model.encoders.7.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 41,
"name": "model.encoders.7.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 42,
"name": "model.encoders.7.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 43,
"name": "model.encoders.7.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 44,
"name": "model.encoders.7.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 45,
"name": "model.encoders.8.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 46,
"name": "model.encoders.8.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 47,
"name": "model.encoders.8.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 48,
"name": "model.encoders.8.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 49,
"name": "model.encoders.8.feed_forward.w_2.bias"
}
],
"unique_op_types": 28,
"weight_delta_bytes": 1218689,
"weight_delta_mb": 1.16,
"weights_size_bytes": 935960828,
"weights_size_mb": 892.6,
"zero_dim_initializers": 0
},
"sha256": "b1145eb7e9d2dbb9005fc99ed0313efebfadffea4aee1f4fa68b69a359126227",
"sha512": "277a42c8b1dc47f55df706d9b5bf51b43324b792c628cdb149103d9145cd773173b0eb1eecb34952d389a999de2b4d57dc6703b305480b43d8f439885ba0ab70",
"tensor_preview": [
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 0,
"name": "model.encoders0.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 1,
"name": "model.encoders0.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 2,
"name": "model.encoders0.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 3,
"name": "model.encoders0.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 4,
"name": "model.encoders0.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 5,
"name": "model.encoders.0.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 6,
"name": "model.encoders.0.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 7,
"name": "model.encoders.0.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 8,
"name": "model.encoders.0.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 9,
"name": "model.encoders.0.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 10,
"name": "model.encoders.1.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 11,
"name": "model.encoders.1.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 12,
"name": "model.encoders.1.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 13,
"name": "model.encoders.1.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 14,
"name": "model.encoders.1.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 15,
"name": "model.encoders.2.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 16,
"name": "model.encoders.2.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 17,
"name": "model.encoders.2.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 18,
"name": "model.encoders.2.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 19,
"name": "model.encoders.2.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 20,
"name": "model.encoders.3.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 21,
"name": "model.encoders.3.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 22,
"name": "model.encoders.3.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 23,
"name": "model.encoders.3.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 24,
"name": "model.encoders.3.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 25,
"name": "model.encoders.4.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 26,
"name": "model.encoders.4.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 27,
"name": "model.encoders.4.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 28,
"name": "model.encoders.4.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 29,
"name": "model.encoders.4.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 30,
"name": "model.encoders.5.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 31,
"name": "model.encoders.5.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 32,
"name": "model.encoders.5.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 33,
"name": "model.encoders.5.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 34,
"name": "model.encoders.5.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 35,
"name": "model.encoders.6.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 36,
"name": "model.encoders.6.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 37,
"name": "model.encoders.6.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 38,
"name": "model.encoders.6.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 39,
"name": "model.encoders.6.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 40,
"name": "model.encoders.7.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 41,
"name": "model.encoders.7.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 42,
"name": "model.encoders.7.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 43,
"name": "model.encoders.7.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 44,
"name": "model.encoders.7.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 45,
"name": "model.encoders.8.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 46,
"name": "model.encoders.8.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 47,
"name": "model.encoders.8.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 48,
"name": "model.encoders.8.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 49,
"name": "model.encoders.8.feed_forward.w_2.bias"
}
],
"weight_delta_mb": 1.16,
"weights_size_est_bytes": 935960828
},
"report": {
"bullets": [
"ONNX audio-speech model | opset 17 | 7496 nodes | 233,990,207 params | 2 warnings / 5 informational",
"Size: 893.76 MB",
"SHA256: b1145eb7e9d2dbb9..."
],
"recommendations": [
"Add a license field during export (e.g. apache-2.0, mit, cc-by-4.0)",
"Set author and domain fields during model export"
],
"summary": "ONNX audio-speech model | opset 17 | 7496 nodes | 233,990,207 params | 2 warnings / 5 informational"
},
"scan_context": {
"duration_ms": 10925,
"ended_at": "2026-07-09T10:30:38+00:00Z",
"limits": {
"sandbox": true,
"timeout_ms": 60000
},
"mode": "static-deep",
"started_at": "2026-07-09T10:30:38+00:00Z"
},
"security": {
"findings": [
{
"category": "Shape Risk",
"detail": "Inputs with dynamic dims: [\u0027speech\u0027]. Outputs: [\u0027encoder_out\u0027] (symbolic: Addencoder_out_dim_0, encoder_out_length, speech_length). Dynamic dims allow flexible batch sizes and sequence lengths, but without enforced bounds a caller can supply arbitrarily large tensors causing OOM. This is expected for most inference models.",
"recommendation": "Enforce maximum input shape at the serving layer (e.g. ORT SessionOptions.add_session_config_entry, preprocessing validation). Document accepted input bounds in model card or deployment README.",
"severity": "INFO",
"title": "Dynamic tensor dimensions detected"
},
{
"category": "Supply Chain",
"detail": "Models without license information cannot be safely redistributed or deployed commercially. ONNX metadata supports a license property in model.metadata_props.",
"recommendation": "Add a license field during export (e.g. apache-2.0, mit, cc-by-4.0)",
"severity": "LOW",
"title": "No license field in ONNX model metadata"
},
{
"category": "Supply Chain",
"detail": "Neither author nor domain (producer namespace) are set. Without origin information the model cannot be traced to a trusted source.",
"recommendation": "Set author and domain fields during model export",
"severity": "LOW",
"title": "No provenance metadata in ONNX model"
},
{
"category": "Resources",
"detail": "This model has 7,496 nodes, 916 initializers, 233,990,207 parameters, and 936.0 MB of declared weights. Larger graphs have higher memory allocation overhead at load time and may hit per-request limits in serving frameworks.",
"recommendation": "Validate memory and latency under representative maximum input length. Set request concurrency and input-size limits before exposing the model as a service.",
"severity": "INFO",
"title": "Large ONNX graph \u2014 7,496 graph nodes / ~234M parameters"
},
{
"category": "Provenance",
"detail": "Producer metadata helps identify the tool that exported this model",
"recommendation": "Verify producer matches expected export pipeline",
"severity": "INFO",
"title": "Model producer: pytorch 2.3.0"
},
{
"category": "Classification",
"detail": "Based on op inventory (7496 total nodes, 28 unique types)",
"recommendation": "Verify this matches the model\u0027s intended use case",
"severity": "INFO",
"title": "Inferred model type: audio-speech"
},
{
"category": "Runtime",
"detail": "Opset governs which ops and behaviors are available at runtime",
"recommendation": "Use ONNX Runtime (CPU/CUDA/DirectML/OpenVINO backends); requires ORT \u2265 1.14",
"severity": "INFO",
"title": "Default opset: 17"
}
],
"grade": "A",
"score": 94
},
"source": {
"filename": "sense-voice-encoder.onnx",
"hashes": {
"sha256": "b1145eb7e9d2dbb9005fc99ed0313efebfadffea4aee1f4fa68b69a359126227"
},
"input_type": "file",
"size_bytes": 937179517
},
"tensors": {
"count": 916,
"dtype_histogram": {
"FLOAT": 233990207
},
"dtype_stats": {
"FLOAT": {
"avg_bits_per_elem": 32.0,
"bytes": 935960828,
"count": 916,
"mb": 892.6
}
},
"integrity": {
"declared_weight_bytes": 935960828,
"external_refs": [],
"has_external_data": false,
"weight_delta_mb": 1.16,
"weights_size_est_bytes": 935960828
},
"preview": [
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 0,
"name": "model.encoders0.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 1,
"name": "model.encoders0.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 2,
"name": "model.encoders0.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 3,
"name": "model.encoders0.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 4,
"name": "model.encoders0.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 5,
"name": "model.encoders.0.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 6,
"name": "model.encoders.0.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 7,
"name": "model.encoders.0.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 8,
"name": "model.encoders.0.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 9,
"name": "model.encoders.0.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 10,
"name": "model.encoders.1.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 11,
"name": "model.encoders.1.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 12,
"name": "model.encoders.1.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 13,
"name": "model.encoders.1.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 14,
"name": "model.encoders.1.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 15,
"name": "model.encoders.2.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 16,
"name": "model.encoders.2.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 17,
"name": "model.encoders.2.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 18,
"name": "model.encoders.2.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 19,
"name": "model.encoders.2.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 20,
"name": "model.encoders.3.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 21,
"name": "model.encoders.3.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 22,
"name": "model.encoders.3.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 23,
"name": "model.encoders.3.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 24,
"name": "model.encoders.3.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 25,
"name": "model.encoders.4.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 26,
"name": "model.encoders.4.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 27,
"name": "model.encoders.4.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 28,
"name": "model.encoders.4.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 29,
"name": "model.encoders.4.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 30,
"name": "model.encoders.5.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 31,
"name": "model.encoders.5.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 32,
"name": "model.encoders.5.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 33,
"name": "model.encoders.5.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 34,
"name": "model.encoders.5.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 35,
"name": "model.encoders.6.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 36,
"name": "model.encoders.6.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 37,
"name": "model.encoders.6.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 38,
"name": "model.encoders.6.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 39,
"name": "model.encoders.6.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 40,
"name": "model.encoders.7.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 41,
"name": "model.encoders.7.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 42,
"name": "model.encoders.7.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 43,
"name": "model.encoders.7.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 44,
"name": "model.encoders.7.feed_forward.w_2.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 45,
"name": "model.encoders.8.self_attn.linear_out.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 6144,
"dims": [
1536
],
"dtype_name": "FLOAT",
"index": 46,
"name": "model.encoders.8.self_attn.linear_q_k_v.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 22528,
"dims": [
512,
1,
11
],
"dtype_name": "FLOAT",
"index": 47,
"name": "model.encoders.8.self_attn.fsmn_block.weight"
},
{
"bits_per_elem": 32.0,
"byte_len": 8192,
"dims": [
2048
],
"dtype_name": "FLOAT",
"index": 48,
"name": "model.encoders.8.feed_forward.w_1.bias"
},
{
"bits_per_elem": 32.0,
"byte_len": 2048,
"dims": [
512
],
"dtype_name": "FLOAT",
"index": 49,
"name": "model.encoders.8.feed_forward.w_2.bias"
}
]
},
"tokenizer": {}
}