拓冰建站拓冰建站
首页 / 资讯中心 / 正文

面试官:AI 回答要逐字出来,用户还能随时打断,这个接口怎么设计?

面试官把一段需求投到屏幕上“用户发送问题后答案要逐字出现点下停止后台也必须马上停。以后还可能增加实时语音。接口怎么设计”候选人答“用 WebSocket实时需求都走一条长连接。”面试官追问“回答明明是服务端单向推送停止也只是一次指令。为什么一上来就维护全双工连接用户关掉前端连接后台模型就真的停了吗”这道题考的不是会不会报协议名而是能不能把一个“实时需求”拆成几条职责不同的链路。一、这个需求其实要拆成三条链路第一条是提交问题。浏览器通过 POST 创建一次生成任务服务端返回run_id。这个编号会贯穿后续输出、取消和状态查询。第二条是接收答案。可以让原生 EventSource 发起 GET 订阅 SSE也可以让 Fetch 直接读取 POST 的流式 HTTP 响应响应内容仍然可以采用 SSE 事件格式。第三条是停止生成。前端先关闭当前流或调用 AbortController停止继续接收同时再向服务端发送POST /runs/{id}/cancel让后台真正取消模型生成和后续工具调用。这里最容易漏掉一句停止接收不等于停止执行。浏览器断开后如果服务端没有处理取消信号模型可能仍在生成工具也可能继续运行费用和副作用都还在发生。二、答案逐字出来为什么优先考虑 SSE这个场景的数据方向很清楚服务端不断产生内容浏览器持续接收。“逐字出现”只是界面效果网络通常按文字片段传输。SSE 建立在普通 HTTP 响应上事件可以区分为text_delta、tool_status、error和done排查问题时也容易看懂。这里要分清层级SSE 是事件流机制EventSource 和 Fetch 是浏览器接收它的方式。原生 EventSource 适合 GET 订阅提供自动重连和事件 IDFetch 支持 POST、请求体和自定义请求头更灵活但重连、续传通常要由应用自己实现。所以大模型“逐字输出”并不天然需要 WebSocket。POST 负责发命令EventSource 或 Fetch 负责接收流式结果已经能覆盖大多数文字问答。三、用户能打断也不代表必须用 WebSocket“停止”看起来很实时本质上仍可能只是一条低频命令。一次 POST 取消接口足够而且更容易做鉴权、重试和审计。POST 本身不保证幂等取消接口要在业务上按run_id保证。第一次调用返回cancelling后前端再通过GET /runs/{id}查询直到任务进入cancelled。如果任务已经是completed或failed取消接口只能返回原终态不能强行改写重复取消也不能再次触发取消或补偿。如果任务正在调用外部工具还要定义取消边界未开始的步骤可以不再执行已经发出的付款、发信或删除请求可能成功、失败也可能结果未知不能因为前端点了停止就假装撤回。系统需要查询最终结果必要时执行单独且防重复的补偿操作。四、SSE 上线后最容易踩的三个坑第一个坑是连接数。SSE 在 HTTP/1.1 上也能运行但多标签页、多会话并发时浏览器同域连接预算会很紧这时优先考虑 HTTP/2利用多路复用让多条流共享一个连接。第二个坑是“服务端在发页面却半天不出字”。Nginx、网关或 CDN 可能缓存一批数据后再交给浏览器需要检查整条链路的响应缓冲并通过心跳避免空闲连接被中间层关闭。第三个坑是断线续传。事件带id只是起点服务端还要保留一段可重放的数据根据Last-Event-ID补发客户端负责去重并处理历史已经过期的情况。五、什么时候才真正需要 WebSocket当双方都要频繁主动发消息时WebSocket 才更合适。比如多人协同编辑、游戏操作、远程设备控制或者 AI 在执行中不断向用户追问用户又持续发送新的控制事件。代价是应用要自己补齐消息类型、请求编号、确认、幂等、心跳、重连、补发和背压。不能只说“WebSocket 是双向的”就把这些工程问题一起跳过。六、如果以后增加实时语音呢上传录音文件用 HTTP 就够了简单的客户端—AI 服务音频流也可以用 WebSocket 传二进制数据。只有产品开始追求通话级低延迟、弱网下的抖动和丢包处理、回声消除与网络穿透时才值得引入 WebRTC。WebRTC 负责媒体传输但建立会话时交换信令仍然经常要借助 HTTP 或 WebSocket。面试里点到这个边界即可不需要把整道题带成音视频协议题。七、面试官追问30 秒怎么答我会先把需求拆成提交、输出和取消三条链路。POST 创建任务并返回run_id答案是服务端单向流优先用 SSE或者直接读取 Fetch 流用户点击停止时前端中断读取同时调用幂等的取消接口确认后台任务真的进入cancelled。多标签页或多会话时再考虑用 HTTP/2 承载 SSE并处理代理缓冲、心跳和断线重放。只有双方需要频繁主动通信时才上 WebSocket以后增加通话级实时语音再引入 WebRTC。面试官真正想听的不是你选了哪条连接而是每条连接到底负责什么。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门