ANNAS TRI WIDAGDO/PORTFOLIO · 2026
VOL. 01 // TECHNICAL ARCHIVE
■annastriwidagdo.me
SOFTWARE ENGINEER·FULL-STACK WEB DEVELOPER·MACHINE LEARNING ENGINEER
ENTRY 001MEMBUKA ARSIP TEKNIS00% · 01 / 01
Lewati ke konten
■annastriwidagdo.me
  • 01Beranda
  • 02Tentang
  • 03Proyek●
  • 04Blog
  • 05Kontak
LANGEN/ID
■annastriwidagdo.me
  • Software Engineer
  • Full-Stack Web Developer
  • Machine Learning Engineer

JAKARTA, INDONESIA · UTC+7

EMAILannastriw6@gmail.com↗ (dibuka di tab baru)LINKEDIN/in/annastriw↗ (dibuka di tab baru)GITHUB@annastriw↗ (dibuka di tab baru)CONTACTBuka Kontak→

© 2026 Annas Tri Widagdo. Drafted in grids, shipped in code.

←Kembali ke Proyek[INDEX // 07] / ID / PROJECTS / speech-to-text-system
07
●[07 // Machine Learning]

Speech-to-Text System

  • Python
  • Wav2Vec2
  • Hugging Face Transformers
  • Librosa
  • FFmpeg
  • Pandas
Peran
Machine Learning / AI Developer
Status terverifikasi
Workflow selesai
Perbandingan output subtitle dari workflow speech-to-text
🔍 Perbesar Bukti
[COVER]Perbandingan output subtitle dari workflow speech-to-text
[01]

Ringkasan

Workflow Google Colab ini mengubah audio atau video menjadi output transkrip dan subtitle yang dapat digunakan kembali.

Workflow menormalisasi media sumber, menjalankan inferensi dengan model pralatih facebook/wav2vec2-base-960h, serta mengekspor TXT, CSV, JSON, SRT, dan burned-in subtitle.

[02]

Kontribusi Saya

  • 01Membangun alur ingest media untuk sumber audio dan video.
  • 02Mengimplementasikan konversi mono 16 kHz dan pemrosesan berbasis chunk sebelum inferensi.
  • 03Menyusun output transkrip untuk format teks biasa, tabular, JSON, dan subtitle.
  • 04Menambahkan pembuatan SRT dan tahap FFmpeg untuk output burned-in subtitle.
[03]

Catatan Teknis Utama

  • 01Audio dikonversi menjadi mono dengan sample rate 16 kHz sebelum inferensi model.
  • 02Input panjang dibagi menjadi beberapa chunk agar workflow dapat memprosesnya secara berurutan.
  • 03Implementasi menggunakan model pralatih Wav2Vec2 base 960-hour sesuai dokumentasi.
  • 04Catatan proyek yang tersedia tidak mencakup evaluasi benchmark.
[04]

Bukti Visual

Klik untuk melihat resolusi penuh
Bukti alur subtitle speech-to-text
FIG.01Output automatic speech recognition yang menampilkan subtitle video otomatis.
[05]

Tech Stack

  • Python
  • Wav2Vec2
  • Hugging Face Transformers
  • Librosa
  • FFmpeg
  • Pandas
[06]

Status & Tautan

Workflow selesai

Kode sumber atau sistem bersifat internal/tertutup.
← Proyek sebelumnyaMachine Learning Model for Heart Attack Risk Prediction
Kembali ke Proyek
Proyek berikutnya →Thermal Printer Service