Midscene.js 本地模型离线部署指南:4 个环境变量让截图不出内网
Midscene.js 本地模型离线部署指南4 个环境变量让截图不出内网【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene内部系统自动化测试时Midscene.js 会把页面截图和指令发给 AI 模型做理解与定位。默认配置下这些请求走云端 API意味着截图会离开你的网络环境。本文给出完整解法用 Ollama 在本机跑一个 Qwen-VL 系列视觉语言模型VL 模型即能看图说话并给出元素坐标的模型再改 4 个MIDSCENE_MODEL_*环境变量把 Midscene.js 指过去全程零云端依赖。先纠正一个流传很广的误区Midscene.js 并不内置模型运行时仓库里既没有model start这类启动命令也没有useLocalModel开关。它的设计是——只对接 OpenAI 兼容的 HTTP 接口模型跑在哪接口就指向哪。所以离线部署这件事Midscene 这边只做一件事把 4 个环境变量指到本地服务。为什么值得折腾本地模型诉求云端模型本地模型数据不出内网截图发到第三方 API截图只在本机回环断网可用不行可以单步延迟受外网链路影响本地回环毫秒级推理质量旗舰模型上限更高取决于硬件和模型规模注意最后一条本地方案不是免费的。同等任务下7B 级本地模型的定位精度通常低于云端旗舰模型所以适合隐私优先或稳定优先的场景而不是追求极限通过率的场景。选型先想清楚 FAMILY 参数怎么选本地跑通之后真正的第一个坑是MIDSCENE_MODEL_FAMILY。这个参数不改变模型本身它告诉 Midscene 该按哪种模型的坐标习惯去解析返回值不同 VL 模型返回坐标的方式不一样比如有的归一化到 0-1000。family 与模型版本对不上点击位置就会飘。当前主流可选手及部署方式模型Midscene 系列值能否本地部署说明UI-TARS 1.5vlm-ui-tars-doubao-1.5否官方推荐走火山引擎托管推理Qwen-VLqwen2.5-vl / qwen3-vlqwen2.5-vl、qwen3-vl可以Ollama / vLLM 均有现成模型豆包视觉doubao-vision否云端 API结论很直接想完全本地化选 Qwen-VL 系列最省事下面以它为例。3 步完成本地部署第 1 步用 Ollama 拉取 Qwen-VL 模型硬件门槛16GB 内存起步有 NVIDIA 显卡可明显提速Ollama 会自动调用 CUDA。ollama pull qwen2.5-vl:7b ollama serve服务默认监听127.0.0.1:11434它暴露的就是一个 OpenAI 兼容接口。第 2 步把 Midscene.js 指到本地export MIDSCENE_MODEL_BASE_URLhttp://localhost:11434/v1 export MIDSCENE_MODEL_NAMEqwen2.5-vl:7b export MIDSCENE_MODEL_FAMILYqwen2.5-vl export MIDSCENE_MODEL_API_KEYollamaAPI Key 写ollama即可Ollama 不校验鉴权。两个细节BASE_URL以/v1结尾不需要写完整的/chat/completions路径。如果本地模型不支持结构化输出JSON 约束加一行MIDSCENE_MODEL_RESPONSE_FORMATnone否则 Midscene 会尝试用response_format参数部分本地服务会直接报错。第 3 步用 Playground 验证启动 Playground 后把上面的配置粘进设置页跑一句简单指令比如点击搜索框。UI Context 面板能列出可交互元素、Action 区出现执行动作就说明模型链路通了。验证与调试别靠感觉能跑推荐两条轻量验证手段出问题时能快速定位卡在模型还是解析设MIDSCENE_RECORD_MODEL_CALLtrue每次模型的请求和响应会写入本地 JSONL 文件打开就能核对提示词格式与返回坐标在 Playground 里对比 UI Context 元素数量和页面实际内容数量明显偏少通常是模型没解析好。排障对照表症状大概率原因处理Chrome 扩展连 Ollama 报 403扩展默认不访问回环地址设环境变量OLLAMA_ORIGINS*点击位置偏移、点到空白FAMILY 与模型版本不匹配按选型表核对MIDSCENE_MODEL_FAMILY请求超时模型太大或 CPU 推理太慢调大MIDSCENE_MODEL_TIMEOUT或换 3B 级模型报结构解析错误本地服务不支持 JSON 约束MIDSCENE_MODEL_RESPONSE_FORMATnone另外一提Midscene 支持按意图拆分模型Planning 负责规划、Insight 负责读取页面。如果想进一步压成本可以把 Insight 意图指向本地小模型MIDSCENE_INSIGHT_MODEL_*一组变量Planning 留在云端但截图同样会进云端 Insight 请求对隐私要求严格的场景就全放本地。最后本地部署 Midscene.js 的关键只有一句话本地起一个 OpenAI 兼容的 VL 模型服务配齐 4 个MIDSCENE_MODEL_*环境变量再用MIDSCENE_RECORD_MODEL_CALL核对一次调用记录。建议先在低风险测试页验证定位通过率再投入正式用例模型全系列与调试细节可查官方文档 模型配置、模型调试与可观测性数据流向说明见 数据隐私。【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考