拓冰建站拓冰建站
首页 / 资讯中心 / 正文

一条命令跑起LLM与VLM:GenieX高通设备本地推理指南

一条命令跑起LLM与VLMGenieX高通设备本地推理指南【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieXGenieX 是面向高通设备的端侧推理运行时让你在本地 Hexagon NPU、Adreno GPU 和 CPU 上运行 LLM 与 VLM。它支持 GGUF 与 AI Hub 预编译包两类模型适合 Copilot PC、Android 手机和 IoT 板卡的开发者。它到底帮你解决什么数据不能出云推理全程在设备端完成不依赖网络、数据不出设备、响应不排队。⚡NPU 是黑盒不会碰运行时自动识别芯片组把模型调度到 NPU、GPU 或 CPU你只管执行geniex infer 模型。模型来源分散、下载麻烦内置模型管理器一条 pull 打通 Hugging Face、AI Hub 和本地文件并自动缓存。现有代码绑定了云端 API内置 OpenAI 兼容服务器把客户端地址指向 127.0.0.1:18181/v1 即可代码零改动。一张图看懂核心能力一句话版本同一个 C SDK 之下有两个运行时——GGUF 模型走 llama.cppAI Hub 预编译包走 Qualcomm AI Engine Direct。能力模型格式适用硬件典型场景llama.cpp 运行时任意 GGUFNPU · GPU · CPU自带模型、CPU/GPU 回退AI Engine Direct 运行时AI Hub 预编译包仅 NPU极致 NPU 性能多模态 VLMGGUF VLM / AI Hub 包NPU · GPU · CPU图像理解、音频转录llama.cppOpenAI 兼容服务器以上均可同上接上现有云端客户端五分钟跑通环境准备与首条命令只需两条命令装好、跑起来。Windows ARM64Copilot PC从发布页下载安装包运行即可Linux ARM64Dragonwing 板卡一行命令、无需 sudocurl -fsSL https://qaihub-public-assets.s3.us-west-2.amazonaws.com/qai-hub-geniex/install.sh | sh然后跑 Hugging Face 上任意一个 GGUF 模型geniex infer unsloth/Phi-4-mini-instruct-GGUF提示选精度时选默认的 Q4_0——它对 Hexagon NPU 支持最好模型会直接落在 NPU 上。启动后就是交互式聊天会话VLM 场景下把图片拖进终端即可提问。Android 不能直接用 CLI但 SDK 是同一套内核见下文。两种模型格式怎么选GGUF还是AI Hub包先给结论Hugging Face 上的模型走 GGUFllama_cppQualcomm AI Hub 上的模型走预编译包qairt本地文件则先 pull 导入。模型在 Hugging Face→ 用 GGUF 的 llama_cpp 运行时。NPU、GPU、CPU 三种计算单元都能跑Q4_0 精度上 NPUQ8_0/F16 走 GPU/CPU。模型在 Qualcomm AI Hub→ 用 qairt。预编译包按芯片静态量化多为 w4a16只跑 NPU但这是 NPU 性能最高的路径。模型已经在磁盘上→ 先geniex pull local/名称 --local-path /模型路径导入缓存再 infer。GGUF 和 AI Hub 包都适用。没有 NPU 或想回退→ 用 llama_cpp 加--compute cpu或 gpu。qairt 不支持需换 GGUF 模型。进阶玩法与二次开发以上接口都是对同一份 C 头文件 sdk/include/geniex.h 的薄封装选哪个接口取决于你的技术栈CLIgeniex pull下载并缓存模型geniex list查看缓存模型与大小geniex serve在 127.0.0.1:18181 启动 OpenAI 兼容服务geniex config查看和设置芯片组。完整命令见 CLI命令参考。Pythonpip install geniexAPI 对齐 Hugging Face 的from_pretrained()→.generate()原生支持流式输出。见 Python快速上手。Android工程里加一行 Maven 依赖com.qualcomm.qti:geniex-android:0.3.1即可用完整 Kotlin/Java API。见 Android快速上手。C/C直接链接 C SDK细节见 sdk/README.md。源码从https://gitcode.com/GitHub_Trending/ne/GenieX克隆仓库构建指南见 notes/build.md。常见问题FAQ问模型从哪里下载答三个来源Hugging Face 任意兼容 GGUFCLI 自动下载、Qualcomm AI Hub 预编译包模型 ID 以 ai-hub-models/ 开头、本地文件用geniex pull --local-path导入缓存。问NPU 不支持或想强制 CPU 怎么办答llama_cpp 运行时支持 NPU、GPU、CPU 三种计算单元用--compute cpu或--compute gpu指定即可qairt 预编译包只跑 NPU强制指定 CPU/GPU 会报错。llama_cpp 内只有 Q4_0 精度对 NPU 支持最好。问和云端推理 API 有什么区别答云端 API 要把数据发往第三方服务器GenieX 的推理全程在设备端本地完成数据不出设备、也不依赖网络。且服务器 API 兼容 OpenAI现有代码只需把地址改成 127.0.0.1:18181/v1。问手头没有高通设备怎么试答登录 Qualcomm Device CloudQDC开一个远程会话即可在骁龙 X Elite 或 8 Elite 的虚拟机上通过 SSH 跑通全流程。收尾装好 GenieX选一个 Qwen 的 GGUF 模型跑geniex infer五分钟体验本地推理。【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieX创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门