拓冰建站拓冰建站
首页 / 资讯中心 / 正文

VidBee 完整指南:从下载队列到本地转写,用 3 个指标快速定位工作流短板

VidBee 完整指南从下载队列到本地转写用 3 个指标快速定位工作流短板【免费下载链接】VidBeeDownload video and audio from YouTube , TikTok , Twitter , Instagram , Facebook , Twitch , Bilibili , and 1000 sites—or import local media. Create searchable transcripts on your computer, then summarize, translate, or ask questions with your preferred AI provider.项目地址: https://gitcode.com/GitHub_Trending/vi/VidBee两小时的访谈录完音想找一句关于定价的原话难道得反复听VidBee 是一个开源媒体库从 1000 站点下载视频/音频再用本地语音识别把内容变成可搜索、带说话人标注的转写稿之后还能接 AI 做摘要与问答。机制链路、从零跑通、输出读法三件事一次讲完。它到底在做什么一条 URL 变成可搜索转写稿的两条链路VidBee 的下载不是自己实现的输入一条 URL 后程序拼装一份完整的 yt-dlp 参数再交给子进程。格式选择器默认bestvideobestaudio/best——严格组合不可用时自动降级而不是报错网络重试被调到 30 次避免一次抖动就中断任务需要登录的站点可以从本地浏览器注入 cookies。运行期间 yt-dlp 持续吐进度事件队列按并发上限默认 3 个进程调度任务结束再从日志里回捞最终落盘路径。参数拼装见 yt-dlp 参数构建队列调度见 下载核心。转写链路更值得细看识别完全在本地跑sherpa-onnx 引擎而跑之前VidBee 先看机器再挑模型——// packages/transcription/src/asr-recommend.ts 节选 // 从候选里挑当前内存装得下的模型按优先级最多取 3 个 const picked: string[] [] for (const id of ids) { if (picked.includes(id) || !fitsRam(id, ramBytes)) continue picked.push(id) if (picked.length 3) break } return picked.length 0 ? picked : [minimal]输入是内存、CPU、GPU 和界面语言处理是一次 RAM 过滤加按语言分组排序输出最多 3 个候选档位。8GB 内存的低配机只会拿到 whisper-tiny/base 级别高配机配中文则推 sense-voice 或 qwen3逻辑见 模型推荐 与 档位目录。随后管线按检测语音片段 → 说话人聚类 → 逐词识别 → 断句加标点执行产物是一份带说话人、时间戳、文本的结构化记录。从零跑通3 步搭建 VidBee 最小可运行环境准备环境。仓库是 pnpm monorepo桌面端、WebAPI、共享包都在一棵依赖树里。# 克隆仓库并安装依赖 git clone https://gitcode.com/GitHub_Trending/vi/VidBee cd VidBee pnpm install为什么packages/下的下载核心和转写管线被桌面端与 Web 端同时引用跳过根安装后面两步都会缺模块。配置环境。Docker 部署时先定数据目录# .env按需修改 VIDBEE_API_PORT3100 VIDBEE_WEB_PORT3000 # 想让文件直接落在 NAS 上时再配置 # VIDBEE_DOWNLOAD_DIR_HOST/path/to/NAS/downloads为什么全部状态队列、历史、转写、订阅存在同一个 SQLite 文件vidbee.db里数据目录先钉死后期免迁移。启动。# 二选一 docker compose up -d --build # api web 一起起带 /health 自检 pnpm run start:web # 本地开发并行拉起 Fastify API 与 Web 端为什么用 Dockerdocker-compose.yml 里 web 服务要等 api 健康检查通过才启动容器起来即代表链路通了。输出怎么看3 个关键指标逐个讲透一份完成的转写不是一段文本而是一个 TranscriptRecord说话人数组加 segment 数组。 有 3 个字段最值得看。asrTier模型档位——它反映这次运行用了什么质量的模型目录里共 10 档从 whisper-tiny约 75MB、4GB 内存可跑到 qwen3约 840MB、需 16GB 内存。拿到结果后做什么专有名词、术语识别得差就去设置页升档应用会按本机性能给出可升级候选不用盲试。speakers speakerId说话人切分——它反映声纹 embedding 聚类做对没有。做什么两个人的话混进同一个标签时不必重跑识别固定说话人数量后重新聚类即可——代码里对应rediarize选项直接复用识别结果只重做聚类。startMs/endMs confidence时间戳与置信度——它反映文字与媒体流是否对齐。做什么转写页点时间戳可直接跳到播放位置置信度偏低的片段要么升级模型重跑要么换用源站自带字幕记录里sourceKind为captions即此路绕开本地识别。下一步怎么调3 类现象对应的操作路径现象中文识别质量一般。背后原因机器被归到 low/mid 档推荐落在低内存档位上。操作设置里换 sense-voice-2025 或 quality 档中文语言分组有专门排序且均为 int8 量化模型内存开销可控。现象说话人切错一个人被拆成两个标签。背后原因自动聚类阈值在音色相近时失灵。操作固定说话人数量重新聚类几分钟内出结果或直接在转写编辑器里做合并/拆分。现象YouTube 下载 403 或队列卡住。背后原因反爬与弱网。操作先配 cookies支持从本地浏览器读取VidBee 已把--retries提到 30 并摘掉最容易 403 的web播放器客户端仍失败再加代理参数。回到开头那场两小时访谈先拿一条视频完整跑一遍看 asrTier、说话人列表、时间戳这三项输出再决定升模型还是修说话人数量。【免费下载链接】VidBeeDownload video and audio from YouTube , TikTok , Twitter , Instagram , Facebook , Twitch , Bilibili , and 1000 sites—or import local media. Create searchable transcripts on your computer, then summarize, translate, or ask questions with your preferred AI provider.项目地址: https://gitcode.com/GitHub_Trending/vi/VidBee创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门