{"data":[{"id":"google/gemini-3.5-transcribe","canonical_slug":"google/gemini-3.5-transcribe-20260827","hugging_face_id":null,"name":"Google: Gemini 3.5 Transcribe","created":1790295820,"description":"Gemini 3.5 Transcribe is a speech-to-text model from Google. It is suited for synchronous transcription that needs word-level timestamps or speaker diarization, with support for up to eight speakers. Audio...","context_length":98304,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Gemini","instruct_type":null},"pricing":{"prompt":"0.000002","completion":"0.000012"},"top_provider":{"context_length":98304,"max_completion_tokens":32768,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/google/gemini-3.5-transcribe-20260827/endpoints"}},{"id":"fish-audio/transcribe-1-pro","canonical_slug":"fish-audio/transcribe-1-pro-20260924","hugging_face_id":null,"name":"Fish Audio: Transcribe 1 Pro","created":1790278301,"description":"Transcribe 1 Pro is a speech-to-text model from Fish Audio tuned for interviews, meetings, and podcasts. It labels speakers with inline `speaker` markers, preserves emotion and vocal-event cues such as...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Other","instruct_type":null},"pricing":{"prompt":"0.0001","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/fish-audio/transcribe-1-pro-20260924/endpoints"}},{"id":"assemblyai/universal-3-5-pro","canonical_slug":"assemblyai/universal-3-5-pro-20260914","hugging_face_id":null,"name":"AssemblyAI: Universal-3.5 Pro","created":1790090022,"description":"Universal-3.5 Pro is AssemblyAI's speech-to-text model served through its Sync API, returning a complete transcript with word-level timestamps in a single synchronous response for audio clips up to 120 seconds....","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Other","instruct_type":null},"pricing":{"prompt":"0.0000625","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/assemblyai/universal-3-5-pro-20260914/endpoints"}},{"id":"meta/muse-voice-transcribe-1.0","canonical_slug":"meta/muse-voice-transcribe-1.0-20260903","hugging_face_id":null,"name":"Meta: Muse Voice Transcribe 1.0","created":1789146931,"description":"Muse Voice Transcribe 1.0 is a synchronous speech-to-text model from Meta. It is suited for push-to-talk, endpointing, and speaker-aware transcription, with keyword biasing for domain terms and language biasing through...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Other","instruct_type":null},"pricing":{"prompt":"0.00005","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":true},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/meta/muse-voice-transcribe-1.0-20260903/endpoints"}},{"id":"microsoft/mai-transcribe-2","canonical_slug":"microsoft/mai-transcribe-2-20260903","hugging_face_id":null,"name":"Microsoft AI: MAI-Transcribe 2","created":1788396586,"description":"MAI-Transcribe 2 is a multilingual speech-to-text model from Microsoft AI, ranked #1 on the FLEURS multilingual benchmark. It supports 60 languages with automatic language identification, code switching for mixed-language speech,...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Other","instruct_type":null},"pricing":{"prompt":"0.1","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/microsoft/mai-transcribe-2-20260903/endpoints"}},{"id":"nvidia/nemotron-3.5-asr-streaming-multilingual-0.6b","canonical_slug":"nvidia/nemotron-3.5-asr-streaming-multilingual-0.6b-20260813","hugging_face_id":"nvidia/Nemotron-3.5-ASR-Streaming-Multilingual-0.6b","name":"NVIDIA: Nemotron 3.5 ASR Streaming Multilingual 0.6B","created":1786654371,"description":"Nemotron 3.5 ASR Streaming Multilingual 0.6B is a speech recognition model from NVIDIA. Its prompt-conditioned, cache-aware FastConformer-RNNT design targets low-latency transcription across more than 40 languages for real-time captioning, voice...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Other","instruct_type":null},"pricing":{"prompt":"0.00000333","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/nvidia/nemotron-3.5-asr-streaming-multilingual-0.6b-20260813/endpoints"}},{"id":"mistralai/voxtral-small-24b-2507-stt","canonical_slug":"mistralai/voxtral-small-24b-2507-stt-20260813","hugging_face_id":"mistralai/Voxtral-Small-24B-2507","name":"Mistral: Voxtral Small 24B 2507 STT","created":1786654002,"description":"Voxtral Small 24B 2507 STT is a speech transcription model from Mistral AI. It is suited for transcription, translation, and audio understanding workloads that benefit from its larger model capacity.","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Mistral","instruct_type":null},"pricing":{"prompt":"0.00005","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/mistralai/voxtral-small-24b-2507-stt-20260813/endpoints"}},{"id":"mistralai/voxtral-mini-3b-2507","canonical_slug":"mistralai/voxtral-mini-3b-2507-20260813","hugging_face_id":"mistralai/Voxtral-Mini-3B-2507","name":"Mistral: Voxtral Mini 3B 2507","created":1786653980,"description":"Voxtral Mini 3B 2507 is a speech and audio understanding model from Mistral AI. It is suited for transcription, translation, and compact audio processing workloads.","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Mistral","instruct_type":null},"pricing":{"prompt":"0.0000166667","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/mistralai/voxtral-mini-3b-2507-20260813/endpoints"}},{"id":"qwen/qwen3-asr-1.7b","canonical_slug":"qwen/qwen3-asr-1.7b-20260813","hugging_face_id":"Qwen/Qwen3-ASR-1.7B","name":"Qwen: Qwen3 ASR 1.7B","created":1786592646,"description":"Qwen3 ASR 1.7B is an automatic speech recognition model from Qwen. It supports multilingual language identification and transcription across 30 languages and 22 Chinese dialects, with streaming and offline inference...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Qwen3","instruct_type":null},"pricing":{"prompt":"0.0000075","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/qwen/qwen3-asr-1.7b-20260813/endpoints"}},{"id":"qwen/qwen3-asr-0.6b","canonical_slug":"qwen/qwen3-asr-0.6b-20260813","hugging_face_id":"Qwen/Qwen3-ASR-0.6B","name":"Qwen: Qwen3 ASR 0.6B","created":1786591833,"description":"Qwen3 ASR 0.6B is a compact automatic speech recognition model from Qwen. It supports multilingual language identification and transcription across 30 languages and 22 Chinese dialects, with streaming and offline...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Qwen3","instruct_type":null},"pricing":{"prompt":"0.00000333","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/qwen/qwen3-asr-0.6b-20260813/endpoints"}},{"id":"openai/gpt-transcribe","canonical_slug":"openai/gpt-transcribe-20260805","hugging_face_id":null,"name":"OpenAI: GPT Transcribe","created":1785973897,"description":"GPT Transcribe is a high-accuracy speech-to-text model from OpenAI. It is suited for recorded audio, streamed file transcription, and committed Realtime turns, with free-form context, keyword hints, and multiple language...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"GPT","instruct_type":null},"pricing":{"prompt":"0.000075","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":true},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/openai/gpt-transcribe-20260805/endpoints"}},{"id":"fish-audio/transcribe-1","canonical_slug":"fish-audio/transcribe-1-20260729","hugging_face_id":null,"name":"Fish Audio: Transcribe 1","created":1785353735,"description":"Transcribe 1 is a speech-to-text model from Fish Audio. It is suited for audio transcription with automatic language detection and can return timestamped word-level segments when alignment details are requested.","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Other","instruct_type":null},"pricing":{"prompt":"0.0001","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/fish-audio/transcribe-1-20260729/endpoints"}},{"id":"x-ai/grok-stt-1.0","canonical_slug":"x-ai/grok-stt-20260723","hugging_face_id":null,"name":"SpaceXAI: Grok STT 1.0","created":1784817014,"description":"Grok STT is SpaceXAI's speech-to-text model, available via the REST /v1/stt endpoint. It supports transcription with word-level timestamps, optional speaker diarization, and multichannel audio.","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Grok","instruct_type":null},"pricing":{"prompt":"0.0000277777777778","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{"temperature":null,"top_p":null,"top_k":null,"frequency_penalty":null,"presence_penalty":null,"repetition_penalty":null},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/x-ai/grok-stt-20260723/endpoints"}},{"id":"deepgram/nova-3","canonical_slug":"deepgram/nova-3-20260714","hugging_face_id":null,"name":"Deepgram: Nova-3","created":1784075761,"description":"Deepgram Nova-3 general-purpose speech-to-text model with monolingual and multilingual transcription support.","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Other","instruct_type":null},"pricing":{"prompt":"0.0000716666666667","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{"temperature":null,"top_p":null,"top_k":null,"frequency_penalty":null,"presence_penalty":null,"repetition_penalty":null},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/deepgram/nova-3-20260714/endpoints"}},{"id":"microsoft/mai-transcribe-1.5","canonical_slug":"microsoft/mai-transcribe-1.5","hugging_face_id":null,"name":"Microsoft AI: MAI-Transcribe 1.5","created":1780425095,"description":"MAI-Transcribe 1.5 is a multilingual speech-to-text model from Microsoft AI. It is suited for captions, call transcription, subtitling, accessibility, and other voice-enabled applications, with reliable transcription across 43 languages, diverse...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Other","instruct_type":null},"pricing":{"prompt":"0.36","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/microsoft/mai-transcribe-1.5/endpoints"}},{"id":"nvidia/parakeet-tdt-0.6b-v3","canonical_slug":"nvidia/parakeet-tdt-0.6b-v3","hugging_face_id":null,"name":"NVIDIA: Parakeet TDT 0.6B v3","created":1779848335,"description":"Parakeet TDT 0.6B v3 is NVIDIA's 600M-parameter multilingual speech-to-text model built on the FastConformer-TDT architecture. Trained on the Granary dataset (670,000+ hours of audio), it supports automatic language detection across...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Other","instruct_type":null},"pricing":{"prompt":"0.000025","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/nvidia/parakeet-tdt-0.6b-v3/endpoints"}},{"id":"mistralai/voxtral-mini-transcribe","canonical_slug":"mistralai/voxtral-mini-transcribe-2602","hugging_face_id":null,"name":"Mistral: Voxtral Mini Transcribe","created":1778877024,"description":"Voxtral Mini Transcribe is Mistral's speech-to-text model, derived from the Voxtral Mini family. It accepts audio input and returns transcribed text via the standard transcription API. Suited for transcribing meetings,...","context_length":16384,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Mistral","instruct_type":null},"pricing":{"prompt":"0.00005","completion":"0"},"top_provider":{"context_length":16384,"max_completion_tokens":13107,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/mistralai/voxtral-mini-transcribe-2602/endpoints"}},{"id":"qwen/qwen3-asr-flash-2026-02-10","canonical_slug":"qwen/qwen3-asr-flash-2026-02-10","hugging_face_id":null,"name":"Qwen: Qwen3 ASR Flash","created":1778732776,"description":"Qwen3-ASR-Flash is Alibaba's automatic speech recognition service, built on the Qwen3-Omni foundation and trained on tens of millions of hours of multimodal speech data. The model handles 11 languages —...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Qwen3","instruct_type":null},"pricing":{"prompt":"0.000035","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{"temperature":null,"top_p":null,"top_k":null,"frequency_penalty":null,"presence_penalty":null,"repetition_penalty":null},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":"2026-10-09","links":{"details":"/api/v1/models/qwen/qwen3-asr-flash-2026-02-10/endpoints"}},{"id":"google/chirp-3","canonical_slug":"google/chirp-3","hugging_face_id":null,"name":"Google: Chirp 3","created":1777997783,"description":"Chirp 3 is Google's latest multilingual speech-to-text model. It offers enhanced transcription accuracy across 24 GA languages and 77+ preview languages, with support for automatic language detection, automatic punctuation, and...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"Other","instruct_type":null},"pricing":{"prompt":"0.000266666666667","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/google/chirp-3/endpoints"}},{"id":"openai/gpt-4o-mini-transcribe","canonical_slug":"openai/gpt-4o-mini-transcribe","hugging_face_id":null,"name":"OpenAI: GPT-4o Mini Transcribe","created":1777658151,"description":"GPT-4o Mini Transcribe is OpenAI's smaller, cost-efficient speech-to-text model built on GPT-4o Mini audio capabilities. It's priced per token (input and output), making it suitable for high-volume transcription workflows that...","context_length":128000,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"GPT","instruct_type":null},"pricing":{"prompt":"0.00000125","completion":"0.000005"},"top_provider":{"context_length":128000,"max_completion_tokens":115200,"is_moderated":true},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/openai/gpt-4o-mini-transcribe/endpoints"}},{"id":"openai/whisper-large-v3","canonical_slug":"openai/whisper-large-v3","hugging_face_id":"openai/whisper-large-v3","name":"OpenAI: Whisper Large V3","created":1777642266,"description":"Whisper Large V3 is OpenAI's open-source automatic speech recognition model offering both audio transcription and translation. It supports 99+ languages and accepts common audio formats including mp3, mp4, wav, webm,...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"GPT","instruct_type":null},"pricing":{"prompt":"0.0000075","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/openai/whisper-large-v3/endpoints"}},{"id":"openai/whisper-large-v3-turbo","canonical_slug":"openai/whisper-large-v3-turbo","hugging_face_id":"openai/whisper-large-v3-turbo","name":"OpenAI: Whisper Large V3 Turbo","created":1777642266,"description":"Whisper Large V3 Turbo is an optimized version of OpenAI's Whisper Large V3 speech recognition model, designed for speed and cost efficiency. It supports transcription across 99+ languages with a...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"GPT","instruct_type":null},"pricing":{"prompt":"0.00000333","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":false},"per_request_limits":null,"supported_parameters":[],"default_parameters":{},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/openai/whisper-large-v3-turbo/endpoints"}},{"id":"openai/whisper-1","canonical_slug":"openai/whisper-1","hugging_face_id":null,"name":"OpenAI: Whisper 1","created":1777332905,"description":"Whisper is OpenAI's open-source automatic speech recognition model, available via API as `whisper-1`. It supports transcription and translation across 50+ languages from audio files up to 25 MB. Accepts formats...","context_length":0,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"GPT","instruct_type":null},"pricing":{"prompt":"0.0001","completion":"0"},"top_provider":{"context_length":0,"max_completion_tokens":0,"is_moderated":true},"per_request_limits":null,"supported_parameters":[],"default_parameters":{"temperature":null,"top_p":null,"top_k":null,"frequency_penalty":null,"presence_penalty":null,"repetition_penalty":null},"supported_voices":[],"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/openai/whisper-1/endpoints"}},{"id":"openai/gpt-4o-transcribe","canonical_slug":"openai/gpt-4o-transcribe","hugging_face_id":null,"name":"OpenAI: GPT-4o Transcribe","created":1777332895,"description":"GPT-4o Transcribe is OpenAI's high-quality speech-to-text model built on GPT-4o audio capabilities. It's priced per token (input and output), making it suitable for workflows that benefit from token-level billing transparency.","context_length":128000,"architecture":{"modality":"audio->transcription","input_modalities":["audio"],"output_modalities":["transcription"],"tokenizer":"GPT","instruct_type":null},"pricing":{"prompt":"0.0000025","completion":"0.00001"},"top_provider":{"context_length":128000,"max_completion_tokens":115200,"is_moderated":true},"per_request_limits":null,"supported_parameters":[],"default_parameters":{"temperature":null,"top_p":null,"top_k":null,"frequency_penalty":null,"presence_penalty":null,"repetition_penalty":null},"supported_voices":null,"knowledge_cutoff":null,"expiration_date":null,"links":{"details":"/api/v1/models/openai/gpt-4o-transcribe/endpoints"}}],"total_count":24,"links":{"next":null}}