目前使用 whisper-large-v3-turbo ,英文音频效果不错,但是中文识别准确率很差,几乎每个句子都有错。请问有什么更好的模型推荐?
目前使用 whisper-large-v3-turbo ,英文音频效果不错,但是中文识别准确率很差,几乎每个句子都有错。请问有什么更好的模型推荐?
1
jackOff 1 day ago
同求,如果中文每个字的时间轴识别能精准不偏移就完美了
|
2
Muniesa 1 day ago
Qwen3-ASR-1.7B 很多方言口音也能识别
|
3
snow0 1 day ago
项目中用的 qwen-audio-3.0-asr-flash-filetrans ,可以试试
|
4
Liu6 1 day ago
我在前公司部署的是中文采用 funasr , 英文 whisperx
|
5
zlowly 1 day ago
Fun-ASR-Nano 挺不错,以前的 funasr 是非自回归模型,中文同音字之类的很容易出错,后来换了用 LLM 解码器,中文质量肉眼可见的提升,
|
6
simbaCheng 18h 5m ago
Qwen 吧,前些时间用通义听悟,给盗墓笔记和百家讲坛 mp3 制作 lrc 歌词,识别的效果还不错,有错误的但能接受。
|