Whisper tiny speech-to-text (encoder + decoder, transformers.js)
Automatic speech recognition model for transformers.js (q8). Runs on WebGPU or WASM —
60.7 MB downloaded once from models.skillsafe.ai, then cached for every SkillSafe app that
uses it. Inference happens on your device; nothing you enter is uploaded to load it, and it never costs a credit.
Weights from Hugging Face · skillsafe-ai/whisper-tiny, pinned at a4b6e8839e63 — also loadable straight from Hugging Face outside SkillSafe (how).
Details
whisper-tiny-q8@ff417702a4b6e8839e630471d38f68e4380670317efaaff7Files
Each file is served at an immutable URL; the canonical form is the SHA-256 itself. Tokenizer and config JSON are not here by design — they ship in your app bundle.
| Path | Format | Size | SHA-256 | |
|---|---|---|---|---|
onnx/decoder_model_merged_quantized.onnx | onnx | 29.3 MB | 25e807a962b6…faddd3 | |
onnx/encoder_model.onnx | onnx | 31.4 MB | 6642befb640f…3ab1dd |
Signature
Graph inputs and outputs read from the ONNX bytes at vetting — the tensor names your session.run() call feeds and reads. Symbolic dimensions are shown by name.
onnx/decoder_model_merged_quantized.onnx
Inputs
input_idsint64 [batch_size, decoder_sequence_length]encoder_hidden_statesfloat32 [batch_size, encoder_sequence_length / 2, 384]past_key_values.0.decoder.keyfloat32 [batch_size, 6, past_decoder_sequence_length, 64]past_key_values.0.decoder.valuefloat32 [batch_size, 6, past_decoder_sequence_length, 64]past_key_values.0.encoder.keyfloat32 [batch_size, 6, encoder_sequence_length_out, 64]past_key_values.0.encoder.valuefloat32 [batch_size, 6, encoder_sequence_length_out, 64]past_key_values.1.decoder.keyfloat32 [batch_size, 6, past_decoder_sequence_length, 64]past_key_values.1.decoder.valuefloat32 [batch_size, 6, past_decoder_sequence_length, 64]past_key_values.1.encoder.keyfloat32 [batch_size, 6, encoder_sequence_length_out, 64]past_key_values.1.encoder.valuefloat32 [batch_size, 6, encoder_sequence_length_out, 64]past_key_values.2.decoder.keyfloat32 [batch_size, 6, past_decoder_sequence_length, 64]past_key_values.2.decoder.valuefloat32 [batch_size, 6, past_decoder_sequence_length, 64]past_key_values.2.encoder.keyfloat32 [batch_size, 6, encoder_sequence_length_out, 64]past_key_values.2.encoder.valuefloat32 [batch_size, 6, encoder_sequence_length_out, 64]past_key_values.3.decoder.keyfloat32 [batch_size, 6, past_decoder_sequence_length, 64]past_key_values.3.decoder.valuefloat32 [batch_size, 6, past_decoder_sequence_length, 64]past_key_values.3.encoder.keyfloat32 [batch_size, 6, encoder_sequence_length_out, 64]past_key_values.3.encoder.valuefloat32 [batch_size, 6, encoder_sequence_length_out, 64]use_cache_branchbool [1]
Outputs
logitsfloat32 [batch_size, decoder_sequence_length, 51865]present.0.decoder.keyfloat32 [batch_size, 6, past_decoder_sequence_length + 1, 64]present.0.decoder.valuefloat32 [batch_size, 6, past_decoder_sequence_length + 1, 64]present.0.encoder.keyfloat32 [batch_size, 6, encoder_sequence_length_out, 64]present.0.encoder.valuefloat32 [batch_size, 6, encoder_sequence_length_out, 64]present.1.decoder.keyfloat32 [batch_size, 6, past_decoder_sequence_length + 1, 64]present.1.decoder.valuefloat32 [batch_size, 6, past_decoder_sequence_length + 1, 64]present.1.encoder.keyfloat32 [batch_size, 6, encoder_sequence_length_out, 64]present.1.encoder.valuefloat32 [batch_size, 6, encoder_sequence_length_out, 64]present.2.decoder.keyfloat32 [batch_size, 6, past_decoder_sequence_length + 1, 64]present.2.decoder.valuefloat32 [batch_size, 6, past_decoder_sequence_length + 1, 64]present.2.encoder.keyfloat32 [batch_size, 6, encoder_sequence_length_out, 64]present.2.encoder.valuefloat32 [batch_size, 6, encoder_sequence_length_out, 64]present.3.decoder.keyfloat32 [batch_size, 6, past_decoder_sequence_length + 1, 64]present.3.decoder.valuefloat32 [batch_size, 6, past_decoder_sequence_length + 1, 64]present.3.encoder.keyfloat32 [batch_size, 6, encoder_sequence_length_out, 64]present.3.encoder.valuefloat32 [batch_size, 6, encoder_sequence_length_out, 64]
onnx/encoder_model.onnx
Inputs
input_featuresfloat32 [batch_size, feature_size, encoder_sequence_length]
Outputs
last_hidden_statefloat32 [batch_size, encoder_sequence_length / 2, 384]
Use it in an app declaration · SDK loader · transformers.js · URLs · Hugging Face — generated from this entry
Add to the body of POST /v1/apps/{slug}/releases (or a release session). An unknown or withdrawn model is refused with a 400 naming it; the app page then shows "downloads 60.7 MB · runs on your device" and /models.txt carries the attribution.
{
"models": [
{
"id": "whisper-tiny-q8",
"revision": "ff417702"
}
]
} Streams with progress, verifies the SHA-256 against the catalogue, keeps a durable copy in the app's Cache API and reports whether the bytes came from cache or the network.
<script src="/sdk.js"></script> <!-- vendored from https://skillsafe.ai/apps-sdk/v1.js -->
const ss = SkillSafe.init({ slug: "your-app" });
const caps = await ss.models.capabilities(); // { webgpu, wasm, wasmSimd, storage }
const files = await ss.models.loadAll("whisper-tiny-q8@ff417702", {
onProgress: (p) => (bar.style.width = Math.round(p.ratio * 100) + "%"),
}); // { path: ArrayBuffer } — SHA-256 verified, cached
const decoder_model_merged_quantized = files["onnx/decoder_model_merged_quantized.onnx"];
const encoder_model = files["onnx/encoder_model.onnx"];
// Later visits: await ss.models.status("whisper-tiny-q8@ff417702") → { cached: [...], missing: [] }
// Background prefetch on a landing page: ss.models.warm("whisper-tiny-q8@ff417702") The runtime itself ships in your bundle as a vetted {path, sha256} reference — only the weights come from the registry. Pass the bytes in; do not re-fetch by URL.
import { env, pipeline } from "./transformers.min.js";
env.allowLocalModels = true;
env.localModelPath = "/models/"; // ship config.json + tokenizer.json at /models/whisper-tiny-q8/
env.allowRemoteModels = true; // only the weights fall through to the registry
env.remoteHost = "https://models.skillsafe.ai/";
env.remotePathTemplate = "{model}@{revision}/"; // → https://models.skillsafe.ai/whisper-tiny-q8@ff417702/onnx/decoder_model_merged_quantized.onnx
const pipe = await pipeline("automatic-speech-recognition", "whisper-tiny-q8", {
revision: "ff417702",
dtype: "q8",
device: "webgpu",
}); Immutable, credential-free, Access-Control-Allow-Origin: *, range requests honoured. The host refuses requests carrying a foreign Origin; a plain curl is fine.
https://models.skillsafe.ai/whisper-tiny-q8@ff417702/onnx/decoder_model_merged_quantized.onnx
https://models.skillsafe.ai/whisper-tiny-q8@ff417702/onnx/encoder_model.onnx curl -sSL -o decoder_model_merged_quantized.onnx "https://models.skillsafe.ai/whisper-tiny-q8@ff417702/onnx/decoder_model_merged_quantized.onnx"
shasum -a 256 decoder_model_merged_quantized.onnx # 25e807a962b6349356d0ea5d0dfe530b7e5bf0e2a484aeca0359d03143faddd3 SkillSafe's copy on Hugging Face — the same bytes (the SHA-256 on each file page matches the hash above), plus manifest.json with the upstream commit, recipe and toolchain, the parity reference tensors and a model card. Use it directly for your own site or notebook. A SkillSafe app must load from the registry: its CSP allows models.skillsafe.ai only, and that copy is what the SDK verifies, the browser shares across apps and the app page discloses. SkillSafe keeps hosting its own copies and the API either way.
// Outside SkillSafe apps only: app hosts allow connect-src models.skillsafe.ai, not huggingface.co.
import { pipeline } from "@huggingface/transformers";
const pipe = await pipeline("automatic-speech-recognition", "skillsafe-ai/whisper-tiny", { revision: "a4b6e8839e630471d38f68e4380670317efaaff7", device: "webgpu" }); https://huggingface.co/skillsafe-ai/whisper-tiny/resolve/a4b6e8839e630471d38f68e4380670317efaaff7/onnx/decoder_model_merged_quantized.onnx
https://huggingface.co/skillsafe-ai/whisper-tiny/resolve/a4b6e8839e630471d38f68e4380670317efaaff7/onnx/encoder_model.onnx Evaluation
onnx.checker + onnxruntime CPU smoke run with zero-filled inputs at the declared shapes; per-file SHA-256 pinned to the source; ONNX output vs the PyTorch model from the same commit on real text (import.parity) — imported as published upstream, then checked. Evaluated Sep 22, 2026.
Parity against transformers WhisperModel from openai/whisper-tiny@169d4a4341b3, fp32 · last_hidden_state
| file | precision | max abs | mean abs | cosine / PSNR |
|---|---|---|---|---|
onnx/encoder_model.onnx | fp32 | 1.1e-3 | 4.3e-6 | 1.000000 |
onnx/encoder_model_fp16.onnx | fp16 | 0.595 | 1.3e-3 | 0.999999 |
Runs under onnxruntime
Zero-filled inputs at the declared shapes, CPU execution provider on the converter host; the check is that the graph loads, runs, and emits the declared output shapes.
onnx/decoder_model_merged.onnx: input_ids[1,4], encoder_hidden_states[1,1500,384], past_key_values.0.decoder.key[1,6,1,64], past_key_values.0.decoder.value[1,6,1,64], past_key_values.0.encoder.key[1,6,1500,64], past_key_values.0.encoder.value[1,6,1500,64], past_key_values.1.decoder.key[1,6,1,64], past_key_values.1.decoder.value[1,6,1,64], past_key_values.1.encoder.key[1,6,1500,64], past_key_values.1.encoder.value[1,6,1500,64], past_key_values.2.decoder.key[1,6,1,64], past_key_values.2.decoder.value[1,6,1,64], past_key_values.2.encoder.key[1,6,1500,64], past_key_values.2.encoder.value[1,6,1500,64], past_key_values.3.decoder.key[1,6,1,64], past_key_values.3.decoder.value[1,6,1,64], past_key_values.3.encoder.key[1,6,1500,64], past_key_values.3.encoder.value[1,6,1500,64], use_cache_branch[1] → logits[1,4,51865], present.0.decoder.key[1,6,4,64], present.0.decoder.value[1,6,4,64], present.0.encoder.key[1,6,1500,64], present.0.encoder.value[1,6,1500,64], present.1.decoder.key[1,6,4,64], present.1.decoder.value[1,6,4,64], present.1.encoder.key[1,6,1500,64], present.1.encoder.value[1,6,1500,64], present.2.decoder.key[1,6,4,64], present.2.decoder.value[1,6,4,64], present.2.encoder.key[1,6,1500,64], present.2.encoder.value[1,6,1500,64], present.3.decoder.key[1,6,4,64], present.3.decoder.value[1,6,4,64], present.3.encoder.key[1,6,1500,64], present.3.encoder.value[1,6,1500,64] 10.7 msonnx/decoder_model_merged_fp16.onnx: input_ids[1,4], encoder_hidden_states[1,1500,384], past_key_values.0.decoder.key[1,6,1,64], past_key_values.0.decoder.value[1,6,1,64], past_key_values.0.encoder.key[1,6,1500,64], past_key_values.0.encoder.value[1,6,1500,64], past_key_values.1.decoder.key[1,6,1,64], past_key_values.1.decoder.value[1,6,1,64], past_key_values.1.encoder.key[1,6,1500,64], past_key_values.1.encoder.value[1,6,1500,64], past_key_values.2.decoder.key[1,6,1,64], past_key_values.2.decoder.value[1,6,1,64], past_key_values.2.encoder.key[1,6,1500,64], past_key_values.2.encoder.value[1,6,1500,64], past_key_values.3.decoder.key[1,6,1,64], past_key_values.3.decoder.value[1,6,1,64], past_key_values.3.encoder.key[1,6,1500,64], past_key_values.3.encoder.value[1,6,1500,64], use_cache_branch[1] → logits[1,4,51865], present.0.decoder.key[1,6,4,64], present.0.decoder.value[1,6,4,64], present.0.encoder.key[1,6,1500,64], present.0.encoder.value[1,6,1500,64], present.1.decoder.key[1,6,4,64], present.1.decoder.value[1,6,4,64], present.1.encoder.key[1,6,1500,64], present.1.encoder.value[1,6,1500,64], present.2.decoder.key[1,6,4,64], present.2.decoder.value[1,6,4,64], present.2.encoder.key[1,6,1500,64], present.2.encoder.value[1,6,1500,64], present.3.decoder.key[1,6,4,64], present.3.decoder.value[1,6,4,64], present.3.encoder.key[1,6,1500,64], present.3.encoder.value[1,6,1500,64] 21.2 msonnx/decoder_model_merged_quantized.onnx: input_ids[1,4], encoder_hidden_states[1,1500,384], past_key_values.0.decoder.key[1,6,1,64], past_key_values.0.decoder.value[1,6,1,64], past_key_values.0.encoder.key[1,6,1500,64], past_key_values.0.encoder.value[1,6,1500,64], past_key_values.1.decoder.key[1,6,1,64], past_key_values.1.decoder.value[1,6,1,64], past_key_values.1.encoder.key[1,6,1500,64], past_key_values.1.encoder.value[1,6,1500,64], past_key_values.2.decoder.key[1,6,1,64], past_key_values.2.decoder.value[1,6,1,64], past_key_values.2.encoder.key[1,6,1500,64], past_key_values.2.encoder.value[1,6,1500,64], past_key_values.3.decoder.key[1,6,1,64], past_key_values.3.decoder.value[1,6,1,64], past_key_values.3.encoder.key[1,6,1500,64], past_key_values.3.encoder.value[1,6,1500,64], use_cache_branch[1] → logits[1,4,51865], present.0.decoder.key[1,6,4,64], present.0.decoder.value[1,6,4,64], present.0.encoder.key[1,6,1500,64], present.0.encoder.value[1,6,1500,64], present.1.decoder.key[1,6,4,64], present.1.decoder.value[1,6,4,64], present.1.encoder.key[1,6,1500,64], present.1.encoder.value[1,6,1500,64], present.2.decoder.key[1,6,4,64], present.2.decoder.value[1,6,4,64], present.2.encoder.key[1,6,1500,64], present.2.encoder.value[1,6,1500,64], present.3.decoder.key[1,6,4,64], present.3.decoder.value[1,6,4,64], present.3.encoder.key[1,6,1500,64], present.3.encoder.value[1,6,1500,64] 11.9 msonnx/encoder_model.onnx: input_features[1,80,3000] → last_hidden_state[1,1500,384] 39.5 msonnx/encoder_model_fp16.onnx: input_features[1,80,3000] → last_hidden_state[1,1500,384] 62.7 ms
Toolchain: python 3.12.13 · platform Darwin 25.6.0 arm64 · torch 2.10.0 · onnx 1.23.0 · onnxruntime 1.30.0. Recipe models/recipes/whisper-tiny.yaml (199acdcb6a95). Full manifest.json
Licence & attribution
Apache-2.0 · licence text · notice
Whisper tiny: Copyright 2022 OpenAI, Apache License 2.0 (https://github.com/openai/whisper); ONNX export by onnx-community (https://huggingface.co/onnx-community/whisper-tiny).
Apps that declare this model get this text in their generated /models.txt, so a licence that requires a notice always carries one.
Every file here was approved by exact SHA-256 after a structural audit of the graph, fetched from a content-pinned source, and is served credential-free at an immutable URL. The SDK re-verifies the hash on your device before it caches or returns anything. Missing a variant? Request it — or read how the registry works.