Преглед на файлове

fix: use beam_size=1 + vad_filter for faster STT inference

Xiaogang Liao преди 4 седмици
родител
ревизия
c75c2759ca
променени са 1 файла, в които са добавени 1 реда и са изтрити 1 реда
  1. 1 1
      cfc-langgraph/app/audio/transcriber.py

+ 1 - 1
cfc-langgraph/app/audio/transcriber.py

@@ -61,7 +61,7 @@ def transcribe_audio(file_path: str, language: str = "zh") -> dict:
         logger.error("音频解码失败 %s: %s", file_path, e)
         raise
 
-    segments, info = _model.transcribe(audio, language=language, beam_size=5)
+    segments, info = _model.transcribe(audio, language=language, beam_size=1, vad_filter=True)
     text = "".join(seg.text for seg in segments).strip()
     return {
         "text": text,