拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Apache PredictionIO Docker 部署指南:用 docker-compose 可插拔存储启动事件服务器、训练与部署推荐引擎

Apache PredictionIO Docker 部署指南用 docker-compose 可插拔存储启动事件服务器、训练与部署推荐引擎【免费下载链接】predictionioPredictionIO, a machine learning server for developers and ML engineers.项目地址: https://gitcode.com/gh_mirrors/pred/predictionio本篇技术指南围绕 docker/README.md 展开完整讲解如何通过 Docker 与 docker-compose 快速拉起 Apache PredictionIO 的完整运行环境包括按需选择 Event / Meta / Model 三类存储后端PostgreSQL、MySQL、Elasticsearch、LocalFS、使用pio-docker封装命令完成注册应用 → 导入数据 → 构建模板 → 训练 → 部署 → 在线查询的推荐引擎全流程并覆盖 Spark 集群训练、Engine Server 独立部署、Jupyter 交互式分析等进阶场景。读完本文你将能够在开发或生产环境中用一套可复用的 docker-compose 组合文件启动 PredictionIO 事件服务器并完成一个可查询推荐结果的端到端演示。一、PredictionIO Docker 概览Apache PredictionIO 是一个面向开发者和 ML 工程师的机器学习服务器其典型的 DASEDataSource、Algorithm、Serving、Evaluator架构由多个组件协作Event Server收集用户行为事件、训练引擎Spark 驱动、Engine Server对外提供查询接口以及存放 metadata / event data / model data 三类数据的存储后端。Docker 化部署把这些组件封装进镜像使开发与生产环境保持一致。仓库中的 docker 目录提供了基础pio镜像定义docker/pio/Dockerfile一系列可组合的 docker-compose 文件用于按需选择存储后端用于在容器内执行pio命令的入口脚本docker/pio/pio_runJupyter 镜像与 docker/JUPYTER.md 文档Kubernetes Helm Chartdocker/charts。与直接在宿主机安装 PredictionIO 相比Docker 方案的核心优势在于存储后端以可插拔方式通过 docker-compose 叠加文件选择无需手工修改pio-env.sh即可切换 PostgreSQL / MySQL / Elasticsearch / LocalFS 等组合。二、核心概念用可选择的 docker-compose 文件决定存储后端PredictionIO 有三类数据仓库分别由环境变量PIO_STORAGE_REPOSITORIES_*指定仓库环境变量前缀用途MetaPIO_STORAGE_REPOSITORIES_METADATA_*存储引擎元数据引擎注册、参数变体等EventPIO_STORAGE_REPOSITORIES_EVENTDATA_*存储事件数据用户行为、属性等供 Event Server 读写ModelPIO_STORAGE_REPOSITORIES_MODELDATA_*存储训练产生的模型docker-compose 目录按存储类型分目录组织每个目录内又按仓库用途拆分为base、meta、event、model四个叠加文件。支持的存储后端组合如下对应 docker/README.md 中的表格类型可选存储EventPostgreSQL、MySQL、ElasticsearchMetaPostgreSQL、MySQL、ElasticsearchModelPostgreSQL、MySQL、LocalFS由于 docker-compose 支持-f指定多个文件并按顺序叠加后加载的键覆盖先加载的键所以可以通过基础文件 任意存储组合的方式启动环境docker-compose -f docker-compose.yml -f ... up2.1 基础文件docker-compose.ymldocker/docker-compose.yml 定义核心pio服务version: 3 services: pio: image: predictionio/pio:latest ports: - 7070:7070 - 8000:8000 volumes: - ./templates:/templates dns: 8.8.8.8要点端口映射7070是 Event Server 端口接收事件写入8000是 Engine Server 查询端口/queries.json卷挂载宿主机./templates目录挂载到容器内/templates模板工程放在宿主机该目录下即可在容器内访问dns: 8.8.8.8用于保证容器内能解析外部域名下载依赖、拉取数据等。2.2 存储后端叠加文件剖析以 PostgreSQL 为例需要叠加 4 个文件docker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ updocker/pgsql/docker-compose.base.yml 启动postgres:9数据库服务用户/密码均为pio--encodingUTF8并通过depends_on保证数据库先就绪同时注入 JDBC 数据源配置environment: PIO_STORAGE_SOURCES_PGSQL_TYPE: jdbc PIO_STORAGE_SOURCES_PGSQL_URL: jdbc:postgresql://postgres/pio PIO_STORAGE_SOURCES_PGSQL_USERNAME: pio PIO_STORAGE_SOURCES_PGSQL_PASSWORD: piodocker/pgsql/docker-compose.meta.yml、docker/pgsql/docker-compose.event.yml、docker/pgsql/docker-compose.model.yml 分别把三个仓库指向PGSQL数据源并命名environment: PIO_STORAGE_REPOSITORIES_METADATA_NAME: pio_meta PIO_STORAGE_REPOSITORIES_METADATA_SOURCE: PGSQL其他后端同理MySQLdocker/mysql/docker-compose.base.yml 使用mysql:8PIO_STORAGE_SOURCES_MYSQL_TYPE: jdbc、PIO_STORAGE_SOURCES_MYSQL_URL: jdbc:mysql://mysql/piometa/event/model 三个文件把仓库指向MYSQLElasticsearchdocker/elasticsearch/docker-compose.base.yml 使用elasticsearch:5.6.4关闭 xpack 各组件security/ml/monitoring/watcher/graph设置cluster.namepredictionio、ES_JAVA_OPTS-Xms1g -Xmx1g并注入PIO_STORAGE_SOURCES_ELASTICSEARCH_HOSTS: elasticsearch、PORTS: 9200、SCHEMES: httpLocalFS仅 Modeldocker/localfs/docker-compose.model.yml 使用本地文件系统存放模型environment: PIO_STORAGE_REPOSITORIES_MODELDATA_NAME: pio_model PIO_STORAGE_REPOSITORIES_MODELDATA_SOURCE: LOCALFS PIO_FS_BASEDIR: /work/pio_store PIO_FS_ENGINESDIR: /work/pio_store/engines PIO_FS_TMPDIR: /work/pio_store/tmp PIO_STORAGE_SOURCES_LOCALFS_TYPE: localfs PIO_STORAGE_SOURCES_LOCALFS_PATH: /work/pio_store/models这些PIO_STORAGE_SOURCES_*/PIO_STORAGE_REPOSITORIES_*/PIO_FS_*环境变量与pio-env.sh中的配置一一对应容器启动时会被加载为 PredictionIO 的存储配置。注意叠加文件之间是仓库用途的解耦例如 Model 完全可以换成 LocalFS 而保持 Meta/Event 用 PostgreSQL。三、实战教程用 Docker 构建一个推荐引擎下面完整复现 docker/README.md 的推荐模板演示流程。3.1 启动 PredictionIO 环境以 PostgreSQL 作为三类存储启动环境$ docker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ up容器启动后docker/pio/pio_run 入口脚本会依次执行若配置了 Elasticsearch 数据源则循环等待 ES 集群健康状态变为 green最多重试 10 次若配置了 MySQL 数据源则检查$PIO_HOME/lib/mysql-connector-java-$MYSQL_VERSION.jar是否存在不存在则自动下载循环执行pio status等待 PredictionIO 就绪最后默认启动 Event Serverpio eventserver除非设置了PIO_RUN_FILE见下文 Engine Server 一节。3.2 使用 pio-docker 封装命令仓库为pio命令提供了容器内的封装pio-docker它在 PredictionIO 容器内执行对应的pio子命令使你不必手动docker exec。将仓库根目录的bin加入 PATH 后即可使用$ export PATHpwd/bin:$PATH $ pio-docker status ... [INFO] [Management$] Your system is all ready to go.3.3 下载推荐模板本演示使用 Apache PredictionIO 的推荐模板recommender template。进入挂载目录并克隆模板$ cd templates $ git clone https://github.com/apache/predictionio-template-recommender.git MyRecommendation $ cd MyRecommendation由于./templates已挂载进容器/templates模板源码在容器内可见。3.4 注册应用Application每个引擎对应一个 Application需要先在 PredictionIO 中注册以获取 Access Key$ pio-docker app new MyApp1 [INFO] [App$] Initialized Event Store for this app ID: 1. [INFO] [Pio$] Created a new app: [INFO] [Pio$] Name: MyApp1 [INFO] [Pio$] ID: 1 [INFO] [Pio$] Access Key: i-zc4EleEM577EJhx3CzQhZZ0NnjBKKdSbp3MiR5JDb2zdTKKzH9nF6KLqjlMnvlAccess Key 是后续导入数据、写事件的凭证先保存到环境变量$ ACCESS_KEYi-zc4EleEM577EJhx3CzQhZZ0NnjBKKdSbp3MiR5JDb2zdTKKzH9nF6KLqjlMnvl同时模板的engine.json中datasource.params.appName默认是占位符INVALID_APP_NAME必须改成MyApp1datasource: { params : { appName: MyApp1 } }3.5 导入训练数据模板提供了 Python 导入脚本它依赖 PredictionIO Python SDK$ pip install predictionio下载 MovieLens 样例数据并导入事件服务器$ curl https://raw.githubusercontent.com/apache/spark/master/data/mllib/sample_movielens_data.txt --create-dirs -o data/sample_movielens_data.txt $ python data/import_eventserver.py --access_key $ACCESS_KEY该脚本通过 SDK 把rate等事件写入运行在7070端口的 Event Server。事件数据会落到你在第 2 节选择的 Event 存储中。3.6 构建模板推荐模板是 Scala 工程需要由pio build编译打包$ pio-docker build --verbose构建产物与依赖Spark、Elasticsearch 等都由容器内预装的环境提供详见 docker/pio/Dockerfile。3.7 训练并生成模型执行训练子命令$ pio-docker train训练由 Spark 驱动默认使用容器内嵌的 Spark 本地模式若叠加了 Spark 集群文件见第 4.2 节训练完成后模型写入 Model 存储如 PostgreSQL 或 LocalFS 的/work/pio_store/models。3.8 部署并查询推荐结果模型训练成功后部署到 Prediction Server$ pio-docker deploy部署成功后Engine Server 在8000端口对外提供查询接口。发送一个推荐请求$ curl -H Content-Type: application/json \ -d { user: 1, num: 4 } http://localhost:8000/queries.json返回的 JSON 即为该用户 Top-4 推荐项列表。至此一个完整的数据收集 → 训练 → 服务闭环已在 Docker 环境中跑通。四、进阶主题4.1 使用 Elasticsearch 作为 Meta / Event 存储Elasticsearch 可作 Meta 与 Event 存储Model 存储没有 ES 支持示例中改用 LocalFSdocker-compose -f docker-compose.yml \ -f elasticsearch/docker-compose.base.yml \ -f elasticsearch/docker-compose.meta.yml \ -f elasticsearch/docker-compose.event.yml \ -f localfs/docker-compose.model.yml \ up4.2 使用 Spark 集群训练在基础组合之外追加 docker/docker-compose.spark.yml即可拉起独立的 Spark Master 与 Workerdocker-compose -f docker-compose.yml \ -f docker-compose.spark.yml \ -f elasticsearch/docker-compose.base.yml \ -f elasticsearch/docker-compose.meta.yml \ -f elasticsearch/docker-compose.event.yml \ -f localfs/docker-compose.model.yml \ up该文件使用bde2020/spark-master:2.2.2-hadoop2.7与bde2020/spark-worker:2.2.2-hadoop2.7镜像Master 暴露8080Web UI与7077Spark 通信端口Worker 通过SPARK_MASTERspark://spark-master:7077注册。将训练任务提交到集群时通过--master指定 Spark 集群地址注意pio train自身参数用--分隔pio-docker train -- --master spark://spark-master:7077如需调整集群配置直接修改 docker/docker-compose.spark.yml例如增加 Worker 数量、调整端口。4.3 独立部署 Engine Serverpio-docker deploy是在容器内手动部署如果希望容器启动即自动部署指定引擎可追加 docker/docker-compose.deploy.ymldocker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ -f docker-compose.deploy.yml \ up该文件设置environment: - PIO_TEMPLATE_NAMEMyRecommendation - PIO_RUN_FILE/deploy/run.sh volumes: - ./deploy:/deployPIO_RUN_FILE会改变容器入口行为pio_run检测到该变量后不再启动 Event Server而是执行 docker/deploy/run.shcd /templates/$PIO_TEMPLATE_NAME pio deploy即进入模板目录并执行pio deploy把引擎常驻部署为服务。修改部署行为时可调整PIO_TEMPLATE_NAME与deploy/run.sh。4.4 与 Jupyter 结合做探索性数据分析EDA追加 docker/docker-compose.jupyter.yml 可启动带 Jupyter Notebook 的环境docker-compose -f docker-compose.jupyter.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ up该文件使用predictionio/pio-jupyter:latest镜像额外映射8888端口并把./templates挂载到/home/jovyan/templates。启动后在浏览器打开http://127.0.0.1:8888/从New下拉菜单打开终端即可在 PredictionIO 环境内执行pio命令进行探索性数据分析EDA。更完整的说明含 Scala 模板与 Python 模板两套入门流程、pio train --main-py-file train.py等用法见 docker/JUPYTER.md。五、开发与发布构建、打标签与推送镜像5.1 构建基础镜像基础镜像定义在 docker/pio/Dockerfile其构建逻辑值得注意基础镜像为openjdk:8内置版本Scala2.11.12、Spark2.2.3、Hadoop2.7.7、Elasticsearch5.5.3、PostgreSQL JDBC42.2.4、MySQL JDBC8.0.12从源码仓库 checkoutv0.13.0标签执行make-distribution.sh -Dscala.version... -Dspark.version... -Dhadoop.version... -Delasticsearch.version... --with-deb构建 deb 包并安装到/usr/share/predictionio即PIO_HOME初始化/etc/predictionio/pio-env.sh写入POSTGRES_JDBC_DRIVER、MYSQL_JDBC_DRIVER、SPARK_HOME等变量EXPOSE 7070 8000默认CMD [sh, /usr/bin/pio_run]。构建命令docker build -t predictionio/pio pio5.2 构建 Jupyter 镜像docker build -t predictionio/pio-jupyter jupyter5.3 推送镜像发布流程docker push predictionio/pio:latest docker tag predictionio/pio:latest predictionio/pio:$PIO_VERSION docker push predictionio/pio:$PIO_VERSION其中$PIO_VERSION对应发布版本号如v0.13.0保证latest与版本标签同步发布。六、小结与进一步探索本文围绕 docker/README.md 梳理了 Apache PredictionIO 的 Docker 化部署全貌通过 docker-compose 叠加文件自由组合 Meta / Event / Model 三类存储PostgreSQL、MySQL、Elasticsearch、LocalFS用pio-docker在容器内完成从应用注册到推荐查询的完整引擎生命周期并支持 Spark 集群训练、自动部署 Engine Server、Jupyter EDA 等进阶用法。在此基础上还可进一步阅读docker/pio/pio_run容器入口脚本理解启动等待与 Event Server / 部署脚本的分流逻辑docker/pio/Dockerfile镜像内部版本矩阵与构建过程docker/docker-compose.deploy.yml 与 docker/deploy/run.sh自动部署机制docker/docker-compose.spark.ymlSpark 集群编排docker/JUPYTER.mdJupyter 环境下的完整模板演练docker/charts面向 Kubernetes 的 Helm Chart 部署方案。【免费下载链接】predictionioPredictionIO, a machine learning server for developers and ML engineers.项目地址: https://gitcode.com/gh_mirrors/pred/predictionio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门