[07 // Machine Learning]
Speech-to-Text System
- Python
- Wav2Vec2
- Hugging Face Transformers
- Librosa
- FFmpeg
- Pandas

[01]
Ringkasan
Workflow Google Colab ini mengubah audio atau video menjadi output transkrip dan subtitle yang dapat digunakan kembali.
Workflow menormalisasi media sumber, menjalankan inferensi dengan model pralatih facebook/wav2vec2-base-960h, serta mengekspor TXT, CSV, JSON, SRT, dan burned-in subtitle.
[02]
Kontribusi Saya
- Membangun alur ingest media untuk sumber audio dan video.
- Mengimplementasikan konversi mono 16 kHz dan pemrosesan berbasis chunk sebelum inferensi.
- Menyusun output transkrip untuk format teks biasa, tabular, JSON, dan subtitle.
- Menambahkan pembuatan SRT dan tahap FFmpeg untuk output burned-in subtitle.
[03]
Catatan Teknis Utama
- Audio dikonversi menjadi mono dengan sample rate 16 kHz sebelum inferensi model.
- Input panjang dibagi menjadi beberapa chunk agar workflow dapat memprosesnya secara berurutan.
- Implementasi menggunakan model pralatih Wav2Vec2 base 960-hour sesuai dokumentasi.
- Catatan proyek yang tersedia tidak mencakup evaluasi benchmark.
[04]
Bukti Visual

[05]
Tech Stack
- Python
- Wav2Vec2
- Hugging Face Transformers
- Librosa
- FFmpeg
- Pandas
[06]
Status & Tautan
Workflow selesai
Kode sumber atau sistem bersifat internal/tertutup.