让产品自己“开口说话”:xiaomu-meeting + Hermes,打造新一代实时互动智能演示机器人

发布时间:2026/7/31 9:46:38
让产品自己“开口说话”:xiaomu-meeting + Hermes,打造新一代实时互动智能演示机器人 引言产品演示的“三难困境”你是否有过这样的经历销售团队花了三天时间准备一场产品演示客户终于上线了。打开共享屏幕开始逐页讲解PPT——讲到第三页客户问了一个关于某个功能的问题。销售不得不停下来说“这个问题我稍后让产品经理给您解答”然后继续往下翻。演示结束后客户提了七八个问题销售记了满满一页纸回去之后整理、确认、再答复——三天过去了客户的热情已经凉了。或者反过来——你是客户。某天你登录一家SaaS厂商的官网看到“预约演示”的按钮你点了填了手机号。第二天销售打电话来约时间第三天终于上线了。一个小时的演示你其实只想了解三个功能点但销售按照标准流程从头讲到尾。你不好意思打断只好硬着头皮听完最后也没搞清楚那三个功能到底能不能满足你的需求。你花了三天得到了一个模棱两可的答案。这就是产品演示的“三难困境”成本高一场高质量的演示需要销售、售前、产品多方配合时间成本、人力成本居高不下体验差客户的问题无法在演示过程中得到即时解答信息断层严重效率低一场演示只能服务一个客户无法规模化如果有一种方案能让产品自己“开口说话”——7×24小时在线、随时响应客户提问、一边操作产品一边语音讲解、演示结束后还能根据客户的问题自动生成个性化说明文档——你会不会立刻想要今天我们就来聊聊这套方案xiaomu-meeting Hermes Agent用开源技术打造的新一代实时互动智能演示机器人。第一章 系统全景从“人演示”到“产品自演示”1.1 传统产品演示的困境在深入技术方案之前我们先来看看传统产品演示到底痛在哪里。痛点一人力成本高企一个标准的SaaS产品演示流程是这样的销售获取线索→售前工程师了解客户需求→定制演示脚本→预约演示时间→正式演示→会后整理问答→发送跟进资料。一套流程走下来平均需要5-8个工时。如果客户多售前团队不堪重负如果客户少养不起专职售前。痛点二演示质量参差不齐同一个产品不同售前讲出来效果天差地别。经验丰富的售前知道什么时候该深入、什么时候该跳过新人只能照着PPT念。客户的体验完全取决于被分配到了哪个售前。痛点三客户问题无法即时解答这是最致命的。演示过程中客户提出的问题售前往往无法当场给出准确答案——要么是“我确认一下再答复您”要么是“这个问题比较复杂我约产品经理跟您单独沟通”。问题被拖延决策被推迟商机在等待中流失。痛点四无法规模化一个售前一天最多做2-3场演示。当线索量爆发时演示排期成了销售漏斗中最粗的瓶颈。1.2 新一代方案让产品自己“开口说话”xiaomu-meeting Hermes Agent的组合方案从根本上重构了产品演示的交付方式。这套方案的核心逻辑是产品自己就是最好的讲解员。客户进入演示页面机器人主动发起语音通话开始讲解产品功能讲解过程中机器人通过Hermes Agent实时操作Demo页面一边操作一边说明客户随时可以语音打断提出问题机器人记录当前脚本节点通过Hermes Agent处理问题并操作Demo演示答案再从断点继续讲解演示结束后系统根据客户在演示中提出的问题自动生成个性化说明文档一场演示从预约到完成全自动、7×24小时、可规模化。第二章 技术架构四层体系环环相扣这套系统的技术架构可以概括为四层体系text复制下载┌─────────────────────────────────────────────────────────────────────┐ │ 用户层客户终端 │ │ Web浏览器 / 移动端 / 桌面客户端 │ │ ↓ 实时音视频 桌面共享 │ ├─────────────────────────────────────────────────────────────────────┤ │ xiaomu实时互动平台信令 媒体 │ │ WebRTC信令服务 │ 媒体转发服务 │ 会话管理 │ │ ↓ IM通道指令/状态/事件 │ ├─────────────────────────────────────────────────────────────────────┤ │ xiaomu机器人Ubuntu/Windows/Mac 客户端 │ │ 桌面共享引擎 │ 语音引擎 │ 脚本引擎 │ 状态管理 │ │ ↓ 通过IM通道发送演示功能指令 │ ├─────────────────────────────────────────────────────────────────────┤ │ Hermes Agent智能决策与执行层 │ │ browser工具 │ computer_use工具 │ 知识库 │ 记忆系统 │ │ ↓ 直接控制 │ │ Demo服务器产品演示环境 │ └─────────────────────────────────────────────────────────────────────┘2.1 第一层用户层——客户终端客户通过Web浏览器或移动端、桌面客户端进入演示页面。无需安装任何插件打开浏览器即可接入。页面内嵌了xiaomu-meeting的WebRTC客户端客户点击“开始演示”按钮系统自动建立与xiaomu机器人的实时音视频连接。2.2 第二层xiaomu实时互动平台——信令与媒体的中枢xiaomu-meeting是一款开源的私有化视频会议系统通过Docker Compose即可一键部署。它在这套方案中承担着实时互动平台的核心角色信令服务负责会话建立、媒体协商、状态同步媒体转发服务实时音视频数据的转发与分发会话管理演示会话的创建、维护、销毁xiaomu实时互动平台是整个系统的信息高速公路——客户端的音视频上行到这里机器人的桌面共享下行到这里所有的信令交互、状态同步都经过这里。关键特性私有化部署所有数据运行在自己的服务器上低延迟基于WebRTC技术端到端延迟可低至600ms多端支持Web、移动端、桌面端全覆盖2.3 第三层xiaomu机器人——交互控制与状态管理的“指挥官”xiaomu机器人是运行在Ubuntu/Windows/Mac上的客户端程序。它是整个演示系统的协调层——负责与客户进行语音交互、管理演示脚本进度、通过IM通道向Hermes Agent发送操作指令。一桌面共享引擎xiaomu机器人通过xiaomu实时互动平台将服务器的桌面实时共享给客户端的客户。客户在浏览器中看到的不再是静态的PPT而是真实的、可操作的Demo界面。二语音引擎集成Hermes Agent的语音交互能力xiaomu机器人支持实时语音讲解。客户听到的是流畅、自然的语音而非生硬的TTS机械音。三脚本引擎这是最核心的组件之一。演示脚本是预先编写好的——包含讲解话术和对应的Demo操作意图。例如text复制下载节点1打开登录页面 → “欢迎来到我们的产品演示首先我们来看一下登录流程……” 节点2输入账号密码 → “您可以使用手机号或邮箱登录……” 节点3进入仪表盘 → “登录后首先看到的是数据总览仪表盘……” 节点4创建新项目 → “接下来我们演示如何创建一个新项目……” ……脚本引擎按照预设的脚本顺序逐步执行——每一步都包含“说什么”语音讲解和“做什么”向Hermes发送的操作指令。关键机制xiaomu机器人不直接操作Demo。当脚本执行到需要操作Demo的节点时机器人通过IM通道即时通讯通道向Hermes Agent发送一条结构化指令例如json复制下载{ action: browser_navigate, url: https://demo.example.com/dashboard, node_id: 3 }Hermes Agent接收到指令后调用browser或computer_use工具在Demo服务器上执行实际操作并将执行结果成功/失败、截图等通过IM通道回传给xiaomu机器人。机器人根据回传结果决定继续执行下一个脚本节点还是进行异常处理。四状态管理状态管理负责维护演示的当前进度——当前执行到哪个脚本节点、客户的提问历史、已完成的演示步骤等。当客户打断时状态管理器立即记录断点回答完问题后从断点恢复执行。2.4 第四层Hermes Agent——智能决策与执行的“双手”Hermes Agent是由Nous Research开发的开源AI智能体框架。它在这套方案中扮演着执行者的角色——接收xiaomu机器人的指令控制Demo、理解客户意图、调度工具。Hermes Agent的核心能力包括闭环任务自主执行接收到指令后自主完成完整任务多工具链式调用可串联调用多个工具完成复杂操作长期记忆存储跨会话记住客户信息和偏好本地知识库挂载产品文档、FAQ等可挂载为知识库在本方案中Hermes Agent主要调用两类核心工具一browser工具——浏览器自动化Hermes Agent内置完整的浏览器自动化工具集。通过browser工具Hermes可以打开指定的网页点击页面上的按钮、链接填写表单截图分析页面内容执行JavaScript代码二computer_use工具——桌面自动化computer_use工具让Hermes Agent能够在后台驱动桌面。它的特点是不干扰用户操作不移动用户的光标、不抢占键盘焦点、不切换虚拟桌面截图驱动通过截图识别界面元素然后进行操作元素索引点击通过AX树索引精确定位和点击元素比像素坐标更可靠跨应用操作可在Safari、Chrome等不同应用中操作实际工作流程截图computer_use(actioncapture, modesom, appChrome)——返回带编号覆盖层的截图和AX树索引点击computer_use(actionclick, element7)——按索引点击元素验证操作后重新截图确认状态变化computer_use工具与pyautogui等传统自动化工具的本质区别在于它不模拟鼠标键盘的物理操作而是通过操作系统层面的API直接驱动应用。这意味着用户可以在自己的桌面上继续工作而机器人在后台的另一个Space中操作——互不干扰并行工作。指令交互流程text复制下载xiaomu机器人 →IM通道→ Hermes Agent ↓ 解析指令 ↓ 调用browser/computer_use工具 ↓ 操作Demo服务器 ↓ 返回执行结果 ↓ xiaomu机器人 ←IM通道← Hermes Agent这种设计的好处职责清晰xiaomu机器人专注于会话管理和脚本编排Hermes专注于底层操作可扩展性可以轻松替换或升级Hermes的工具集不影响机器人逻辑异步解耦机器人发送指令后可以继续处理其他任务Hermes在后台执行第三章 核心流程从客户进入到演示结束全链路解析3.1 流程全景图text复制下载客户进入演示页面 ↓ [1] 机器人发起语音通话开始讲解 ↓ [2] 机器人按脚本节点执行 ├─ 播报语音 └─ 通过IM发送操作指令给Hermes → Hermes操作Demo ↓ ┌────┴────┐ │ 客户提问│ └────┬────┘ 是 → [3] 打断机器人讲解 → [4] 记录当前节点 → [5] 客户问题传Hermes → Hermes理解并操作Demo/知识库回答 → [6] 返回回答给机器人播报 → [7] 从断点继续 否 → [8] 继续下一节点 ↓ [9] 脚本执行完毕演示结束 ↓ [10] 根据客户提问生成个性化说明文档3.2 详细流程解析第一步客户进入演示页面客户通过浏览器访问产品的演示Demo页面。页面上有“开始演示”按钮点击后系统自动通过xiaomu实时互动平台建立与xiaomu机器人的连接。第二步机器人发起语音通话开始讲解连接建立后xiaomu机器人主动发起语音通话。客户听到的第一句话是“您好欢迎来到XX产品的功能演示我是您的智能演示助手接下来将由我为您介绍产品的核心功能……”第三步机器人按脚本节点执行——语音 指令机器人启动脚本引擎从第一个脚本节点开始执行。对于每个节点机器人执行两个动作语音讲解通过语音引擎播放对应的话术发送操作指令通过IM通道向Hermes Agent发送一条结构化指令描述需要完成的Demo操作例如脚本节点3的内容是“演示创建项目功能”语音“接下来我们演示如何创建一个新项目点击左上角的‘新建项目’按钮……”指令JSON格式json复制下载{ action: browser_click, selector: #new-project-btn, node_id: 3 }Hermes Agent接收到指令后立即在Demo服务器上执行该操作并将操作结果成功/失败、页面截图等返回给机器人。客户在浏览器中看到的是真实的Demo界面在实时操作——鼠标在移动、按钮在被点击、页面在切换——同时听到机器人的语音讲解。就像有一个真人售前在远程操作和讲解。第四步客户提问打断机器人客户在观看演示的过程中随时可以语音打断机器人的讲解。例如客户说“等一下这个功能支持批量导入吗”系统通过VADVoice Activity Detection语音活动检测实时监测客户的语音输入。当检测到客户说话时立即暂停机器人的语音播放并中断当前脚本节点的执行如有未完成的操作指令也一并暂停。第五步记录当前脚本节点打断发生时状态管理器立即记录当前正在执行的脚本节点编号和执行状态。例如“正在执行节点7批量导入功能演示已讲解60%当前操作指令已发送但未完成。”这个记录至关重要——它确保了回答完客户问题后能够从断点无缝衔接而不是从头开始或跳过关键内容。第六步客户问题处理——由Hermes Agent完成客户的问题通过ASR自动语音识别转写成文字xiaomu机器人将问题文本通过IM通道发送给Hermes Agent。Hermes Agent的处理流程意图理解理解客户问题的真实意图知识检索从产品知识库中检索相关信息工具调用如果需要调用browser/computer_use工具在Demo中演示答案生成回答生成自然语言的回答返回回答将回答文本通过IM通道返回给xiaomu机器人例如客户问“支持批量导入吗”——Hermes Agent理解意图后可能会直接操作Demo打开批量导入页面、展示导入模板、演示导入流程——所有这些操作由Hermes直接在Demo服务器上执行xiaomu机器人只需播放相应的语音解说。第七步机器人播报回答并恢复演示xiaomu机器人收到Hermes返回的回答文本后通过TTS合成语音播报给客户。同时如果Hermes执行了Demo操作客户在屏幕上也能看到相应的页面变化。播报完毕后机器人说“好的我们继续刚才的演示……”然后状态管理器读取之前记录的断点信息从中断处继续执行剩余的脚本节点。整个过程中客户感觉不到任何“跳转”或“断层”——就像在和一个真人售前流畅对话。第八步继续后续脚本节点机器人从断点继续依次执行剩余的脚本节点每个节点都遵循“语音讲解 IM指令发送给Hermes → Hermes操作Demo”的模式直至所有节点执行完毕。第九步演示结束当所有脚本节点执行完毕机器人说“以上就是本次演示的全部内容感谢您的观看。如果您有任何问题随时可以向我提问。”第十步生成个性化说明文档这是整个流程的点睛之笔。演示过程中系统记录了客户提出的所有问题——哪些功能客户关注、哪些场景客户有疑问、哪些操作客户没看懂。演示结束后xiaomu机器人将问题汇总发送给Hermes AgentHermes基于这些问题记录自动生成一份个性化的说明文档针对客户问过的每个问题给出详细的图文说明附上对应的Demo操作截图由Hermes在演示过程中自动截取补充相关的产品文档链接每个客户拿到的文档都是不一样的——取决于他们在演示中问了什么。这份文档不是通用的产品手册而是量身定制的“你的问题我来解答”。第四章 技术特点五大核心优势4.1 实时音视频低延迟交互——最低600ms这套系统基于WebRTC技术构建实时音视频传输通道。WebRTC是W3C标准支持浏览器原生实时音视频通信无需安装任何插件。在正常网络条件下端到端延迟可控制在600ms以内。这意味着客户说话后机器人在600ms内就能响应——几乎感觉不到等待就像在和真人对话。低延迟的实现依赖于多个层面的优化WebRTC底层优化智能带宽预测与拥塞控制信令加速高效的SDP协商与ICE连通性检测媒体处理优化硬件加速编解码4.2 随时打断机器人秒级响应这是与传统的“播放录制视频”式演示最本质的区别。传统演示是单向的——客户只能被动观看有问题只能等演示结束后再问。而本方案是双向互动的——客户随时可以打断机器人即时响应。打断机制的技术实现VAD实时监测持续监测客户端的音频输入优先级抢占检测到客户说话时立即暂停机器人的语音播放和脚本执行同时可选暂停Hermes正在执行的操作状态保存记录当前脚本节点的执行进度问题处理将客户问题交由Hermes Agent处理包括可能需要的Demo操作断点续讲处理完毕后从保存的断点继续4.3 支持浏览器和桌面操作准确实时通过Hermes Agent的browser工具和computer_use工具机器人可以精准控制Demo服务器上的浏览器和桌面应用。browser工具的特点支持多种后端Browser Use、Browserbase、本地基于ariaSnapshot的文本树操作支持截图分析和元素定位computer_use工具的特点后台驱动不干扰用户操作截图驱动SOM/vision/AX模式元素索引点击比像素坐标更可靠支持跨应用操作操作精度达到像素级别——Hermes可以精确点击页面上的任何一个按钮、填写任何一个表单字段。4.4 演示过程录制与语音转写——全流程质控每一场演示都会被完整录制——包括机器人的语音讲解、Demo操作画面、客户的语音提问。录制的内容包括视频录制完整的Demo操作画面音频录制机器人的讲解语音 客户的提问语音语音转写所有语音内容实时转写成文字这些录制内容的价值质控审查管理人员可以回放任意一场演示评估演示质量问题追踪客户提出的问题全部有记录便于后续跟进脚本优化通过分析客户在哪些节点提问最多优化演示脚本培训素材优秀的演示可以作为新售前的培训素材4.5 个性化说明文档自动生成演示结束后系统基于客户在演示中提出的问题自动生成个性化说明文档。生成逻辑问题汇总汇总客户在整个演示过程中提出的所有问题分类整理按功能模块对问题进行分类答案生成Hermes Agent基于产品知识库为每个问题生成详细答案并可补充相关Demo截图文档排版生成结构清晰、图文并茂的PDF或Word文档每个客户拿到的文档都是独一无二的——只包含他们关心的问题和对应的解答。第五章 应用场景谁需要这套系统5.1 SaaS产品厂商这是最直接的受益者。SaaS产品的演示需求量大、频次高、标准化程度高——天然适合用这套系统来规模化交付。典型场景客户在官网点击“预约演示”系统自动安排一场演示。客户在任何时间都可以进入演示无需等待销售排期。效果演示响应时间从“天”缩短到“秒”一个机器人可以同时服务多个客户销售团队从繁琐的演示工作中解放出来专注于高价值环节5.2 企业软件供应商企业软件ERP、CRM、HRM等功能复杂、演示难度大。传统演示中售前需要花大量时间准备演示环境、编写演示脚本、排练演示流程。典型场景潜在客户需要了解某个复杂模块的功能机器人按照预设脚本进行深度演示同时随时回答客户的细节问题。效果演示质量标准化不再依赖个别售前的水平复杂功能的演示可以反复优化脚本越讲越好演示过程可录制作为内部培训和客户复看的素材5.3 硬件产品厂商硬件产品虽然不能“在线上操作”但可以通过3D模型展示、AR/VR演示、操作视频播放等方式进行线上演示。典型场景客户进入演示页面机器人一边展示产品的3D模型一边讲解产品特性客户可以语音提问机器人即时回答。5.4 教育培训机构在线教育机构可以用这套系统进行课程试听——机器人按照预设脚本讲解课程内容学员随时提问机器人即时解答。典型场景潜在学员进入试听页面机器人讲解课程大纲和教学特色学员提问“这个课程适合零基础吗”“学完之后能做什么工作”——机器人即时回答。效果试听体验从“看录像”升级为“互动对话”学员的个性化问题得到即时解答试听转化率显著提升第六章 未来展望从“演示”到“协同”6.1 远程协同操作这是最令人期待的方向。目前的演示是单向的——机器人通过Hermes操作Demo客户观看。未来的方向是双向的——客户和机器人协同操作同一个Demo。想象一下这个场景客户说“我想试一下这个报表导出功能。”机器人回应“好的您点击右上角的‘导出’按钮我帮您选择导出格式。”客户在浏览器中点击“导出”机器人同步通过Hermes在后台选择“Excel格式”——一人一机协同完成操作。这种协同模式的技术基础已经具备xiaomu-meeting的桌面共享能力已经支持双向操作Hermes Agent的computer_use工具已经支持后台精准控制只需要将“机器人独占控制”升级为“人机协同控制”6.2 多机器人协作演示对于复杂的产品一个机器人可能不够——需要多个机器人分工协作。例如机器人A负责产品A模块的演示机器人B负责产品B模块的演示机器人C负责技术架构的讲解客户在演示过程中可以在不同机器人之间无缝切换——就像从一个售前切换到另一个售前。Hermes Agent的多Agent协作框架已经为这种模式做好了准备。6.3 基于演示数据的智能销售每一场演示都是数据的金矿。客户在哪些节点提问最多→ 说明这些功能客户最关注客户在哪些节点沉默最长→ 说明这些功能客户不理解客户问了哪些类型的问题→ 说明客户的真实需求是什么这些数据可以用来优化演示脚本在客户最关注的节点增加深度讲解优化产品设计在客户最困惑的功能上改进交互优化销售策略根据客户的提问类型判断其需求阶段和购买意向第七章 部署与配置快速上手指南7.1 部署架构这套系统采用微服务架构各组件可独立部署、独立扩展组件部署方式说明xiaomu实时互动平台Docker Compose信令媒体服务xiaomu机器人原生应用运行在Ubuntu/Windows/Mac上Hermes AgentDocker/原生智能决策与执行引擎Demo服务器任意产品演示环境7.2 快速部署步骤第一步部署xiaomu实时互动平台bash复制下载git clone https://gitee.com/angk021/xiaomu-meeting.git cd xiaomu-meeting docker-compose up -d第二步部署Hermes Agentbash复制下载git clone https://github.com/NousResearch/hermes-agent.git cd hermes-agent npm install hermes setup配置browser和computer_use工具。第三步配置xiaomu机器人在机器人客户端中配置xiaomu实时互动平台的连接信息Hermes Agent的API地址通过IM通道演示脚本文件路径第四步编写演示脚本按照产品功能编写脚本——每个节点包含话术和对应的操作指令JSON格式指令将被发送给Hermes执行。第五步上线启动所有服务客户即可通过Web页面接入演示。第八章 写在最后让产品自己“开口说话”当xiaomu-meeting的实时音视频能力遇见Hermes Agent的智能决策与桌面操控能力并通过IM通道实现精准的指令协作——演示不再依赖人力——7×24小时在线随到随演互动不再有延迟——最低600ms响应随时打断、即时回答质量不再有差异——脚本标准化每一次演示都是最佳实践跟进不再有遗漏——全程录制、语音转写、个性化文档自动生成一套方案四个开源项目从“人演示”到“产品自演示”的革命性跨越。相关项目地址xiaomu-meetinghttps://gitee.com/angk021/xiaomu-meetingHermes Agenthttps://github.com/NousResearch/hermes-agent现在就动手让你的产品自己“开口说话”