This project contains API for Speech-to-text based on a Whisper speech2text model.
- Through the API:
curl 'localhost:5000/transcribe/' \
-X 'POST' \
-H 'accept: application/json' \
-H 'Content-Type: multipart/form-data' \
-F 'file=@tests/res/test_cs_longer.wav'returns a transcript in the default language (cs):
{"transcript":" Já poruká si dáv za hrad písnicku, prasvý mančelku, mi chéli také proce rukestíku, také prasvě na davitka, také prasvě na to láška. Váte to otáte na pavátku,"}curl 'localhost:5000/transcribe/{lang}' \
-X 'POST' \
-H 'accept: application/json' \
-H 'Content-Type: multipart/form-data' \
-F 'file=@tests/res/test_cs_longer.wav'returns a transcript in a chosen langauge {lang}. See the list of Whisper's supported languages (Appendix D2)
and the encoding of language ids by ISO 639.
- As a python library:
from speech2text_api.whisper import Whisper
wrapper = Whisper(model_name_or_path='openai/whisper-medium')
transcript = wrapper.transcribe_file("tests/res/test_cs_longer.wav", lang="cs")
print(transcript)