拓冰建站拓冰建站
首页 / 资讯中心 / 正文

如何用Transformers把多人会议录音转成文字

如何用Transformers把多人会议录音转成文字【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformersTransformers 的自动语音识别功能能把一段多人混在一条音轨上的会议录音转成文字并用时间戳标出每句话在录音中的位置。想象一下一场三个人开的会录音里你一句我一句你想快速找到“预算”那段讨论从头听完不现实转成文字并带上时间戳后可以直接定位到那几秒。读完本文你可以在自己的录音上跑通这条转写流程并知道两个最影响效果的参数怎么调。 先看效果输入是一段多人同时说话的 WAV 会议录音得到的东西是两部分一段完整文字转写外加一个“时间点 句子”的列表可以顺着列表找到某句话出现在录音的哪一秒。下图里两个人并排干活、声音混在一起的场景就是模型要处理的状态多路人声同处一条音轨。安装与环境准备环境假设Python 3.10Linux 或 macOS。CPU 也能跑有 GPU 会明显快一些。最短路径是两条命令git clone https://gitcode.com/GitHub_Trending/tra/transformers pip install transformers soundfilesoundfile用来读写 WAV 文件transformers提供识别管道本身。如果你只想看官方怎么调 ASR 训练参数语音识别示例目录 里有现成脚本可参考。最小可运行示例下面是全文唯一的核心代码块保存为transcribe.py即可直接运行from transformers import pipeline import soundfile as sf asr pipeline(automatic-speech-recognition, modelopenai/whisper-large-v3) audio, sr sf.read(meeting_3people.wav) out asr(audio, sampling_ratesr, chunk_length_s30, batch_size8, return_timestampsTrue) print(out[text]) for seg in out.get(chunks, []): print(seg[timestamp], seg[text])逐行看它在做什么pipeline(automatic-speech-recognition)把识别模型和音频特征提取器拼成一条即用管道首次运行会自动下载模型权重sf.read读出音频数据audio和它的真实采样率sr两者一起传给管道采样信息才不会丢chunk_length_s30让长录音按 30 秒一段切着喂给模型避免整段一次加载导致显存爆掉return_timestampsTrue给每句附加时间段这是你之后“定位原录音位置”的关键最后循环打印每个分句的时间戳和文字meeting_3people.wav换成你自己的文件即可两个最关键的参数怎么选参数作用建议值chunk_length_s长录音切段长度太短句子容易被拦腰截断太长显存占用高从 15 到 30 之间试普通会议录音取 30 通常稳妥sampling_rate告诉管道“这段音频的真实采样率”传错会导致语速、音调判断异常永远传sf.read返回的sr不要手写其余参数保持默认即可。如果录音明显偏长且机器配置高可以调大batch_size提高吞吐反之就调小。放进真实项目把转写接进你已有的整理流程思路是先拿到带时间戳的句子列表再按关键词扫描命中就打印所在位置。比如for seg in out[chunks]: if 预算 in seg[text]: print(原录音位置(秒):, seg[timestamp][0])验收标准很简单把打印出的时间戳代回原录音播放对应的发言内容和说话顺序应与转写一致能对上说明流程已经可用下一步再把结果导出成带章节的会议纪要。踩坑速查现象转写整句乱码、漏词多。原因两人声音重叠。解法重叠说话是识别里最难的部分预期会差一些尽量用不重叠的片段做验收。现象长录音一跑就显存不足。原因一次性处理整段。解法调小chunk_length_s和batch_size分段喂入。现象听感像变了调时间对不上。原因采样率信息传错。解法把sf.read返回的sr原样传进管道或先把音频重采样到 16kHz 再读。现象第一次运行特别慢。原因在下载模型。解法换个带宽好的机器先跑一次把权重下完之后就走本地缓存。接下来可以做什么如果转写在你的目标语言上不够准可以按 语音识别示例文档 里的流程用自己的标注数据继续微调 Whisper 模型。若在示例脚本里发现 bug按 贡献指南 提交 PR 即可仓库维护者会跟进。【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门