瀏覽代碼

fix: use beam_size=1 + vad_filter for faster STT inference

Xiaogang Liao 4 周之前
父節點
當前提交
c75c2759ca
共有 1 個文件被更改,包括 1 次插入1 次删除
  1. 1 1
      cfc-langgraph/app/audio/transcriber.py

+ 1 - 1
cfc-langgraph/app/audio/transcriber.py

@@ -61,7 +61,7 @@ def transcribe_audio(file_path: str, language: str = "zh") -> dict:
         logger.error("音频解码失败 %s: %s", file_path, e)
         raise
 
-    segments, info = _model.transcribe(audio, language=language, beam_size=5)
+    segments, info = _model.transcribe(audio, language=language, beam_size=1, vad_filter=True)
     text = "".join(seg.text for seg in segments).strip()
     return {
         "text": text,