拓冰建站拓冰建站
首页 / 资讯中心 / 正文

开源大模型食用指南:Qwen3-8B 在 AMD Ryzen AI 平台上的 Lemonade SDK 部署与调用

开源大模型食用指南Qwen3-8B 在 AMD Ryzen AI 平台上的 Lemonade SDK 部署与调用【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llmQwen3-8B 是通义千问系列中性能与体积平衡出色的开源大模型而 AMD Ryzen AI 300 系列处理器凭借集成 NPU 与统一内存架构使其可以在纯 Windows 环境下完成本地推理。本文基于本仓库models_amd/qwen3目录下的部署文档完整讲解在 AMD AI Max 395 平台上使用 Lemonade SDK含 Lemonade Server 与 Python API部署并调用 Qwen3-8B 的全流程读完你即可复现模型下载 → 图形化启动服务 → OpenAI 兼容接口测试 → 自建 FastAPI 服务的完整链路。1. 方案概览在 AMD Ryzen AI 上本地运行 Qwen3-8B与传统的GPU 服务器 CUDA部署路径不同本文方案面向AMD Ryzen AI 300 系列处理器核心特点是统一内存架构CPU、GPU 与 NPU 共享大容量内存本文环境为 128GB免去显存瓶颈模型可直接常驻本地内存NPU 加速XDNA2 架构 NPU 为 AI 推理提供专用算力配合 Lemonade 的混合Hybrid执行模式可以在 CPU/NPU 之间自动调度算子纯本地 OpenAI 兼容Lemonade Server 启动后对外暴露http://localhost:8000/api/v1接口任意 OpenAI 风格客户端requests、openaiSDK均可直接接入。本仓库models_amd目录收录了 AMD 平台已验证的部署教程AMD 平台支持模型列表 中明确列出了当前已验证的硬件范围与模型清单。其中 Qwen3-8B 的部署文档位于 models_amd/qwen3/1-Qwen3-8B-AMD部署调用.md与之配套的还有 gemma3-4b-it AMD 环境准备 与 gemma3-4b-it 模型服务部署它们与本文共用同一套 Lemonade 部署体系可作为交叉参考。2. 环境准备2.1 硬件与系统要求本文基础环境如下---------------- Windows11 CPU AI 395 内存 128G ----------------请确定 AMD 芯片的版本目前支持AI 395和AI 370即 AMD Ryzen AI 300 系列如 AI Max 395、AI Max 370 等。NPU 需要配备 AMD Ryzen AI 300 系列的 Windows 11 电脑及对应驱动请先下载并安装 NPU 驱动程序再继续后续操作。从仓库的 AMD 环境准备文档可以看到AMD 硬件环境支持 涵盖 Ryzen AI 300 系列AI Max 395、AI Max 370、AI Max 385、Radeon RX 系列与 Instinct 计算卡系统推荐 Windows 11 64-bit存储建议预留 50GB 以上可用空间。2.2 NPU 驱动与 Ryzen AI 软件安装先决条件Ryzen AI 软件支持带有神经网络处理单元NPU的 AMD 处理器。安装前需要先满足以下依赖项详见 gemma3-4b-it AMD 环境准备依赖项版本要求Windows 11build 22621.3527Visual Studio2022cmakeversion 3.26Python 发行版推荐 Miniforge最新版本安装要点Visual Studio 2022 Community确保安装了使用 C 的桌面开发工作负载Miniforge确保在系统 PATH 环境变量中设置以下路径之一path\to\miniforge3\condabinpath\to\miniforge3\Scripts\path\to\miniforge3\所有安装程序请务必以管理员权限打开运行。安装 NPU 驱动程序的步骤下载 NPU 驱动程序版本32.0.203.280 或更新版本如 32.0.203.304解压下载的 ZIP 文件以管理员模式打开终端执行.\npu_sw_installer.exe验证安装打开任务管理器 → 性能 → NPU0确认 NPU MCDM 驱动程序已正确安装版本 32.0.203.280 对应日期 5/16/2025或版本 32.0.203.304 对应日期 10/07/2025。安装 Ryzen AI 软件下载安装程序ryzenai-lt-1.6.1.exe按安装向导操作接受许可协议 → 指定安装目标文件夹默认C:\Program Files\RyzenAI\1.6.1→ 指定 conda 环境名称默认ryzen-ai-1.6.1完成后Ryzen AI 软件包已安装在安装程序创建的 conda 环境中。验证安装quicktest安装文件夹的quicktest子目录内置验证脚本在 Miniforge Prompt 中激活环境后运行conda activate env_name # 默认环境名 ryzen-ai-1.6.1 cd %RYZEN_AI_INSTALLATION_PATH%/quicktest python quicktest.py若输出以下内容说明模型已在 NPU 上运行、Ryzen AI 软件安装成功[Vitis AI EP] No. of Operators : NPU 398 VITIS_EP_CPU 2 [Vitis AI EP] No. of Subgraphs : NPU 1 Actually running on NPU 1 Test Passed注意Ryzen AI 软件安装文件夹的完整路径存储在RYZEN_AI_INSTALLATION_PATH环境变量中。2.3 下载并安装 Lemonade完成上述驱动与软件安装后下载lemonade-server进行安装。安装页面中提供了多系统支持Windows 11、Ubuntu 24.04、macOS以及App Server / Server Only两种安装类型其中 Windows 11 的 App Server 方式即可满足本文需求。NPU 需要配备 AMD Ryzen AI 300 系列的 Windows 11 电脑及驱动安装。请先下载并安装 NPU 驱动程序再继续操作。2.4 配置 pip 源并安装依赖首先对pip换源加速下载并安装依赖包# 升级pip python -m pip install --upgrade pip # 更换 pypi 源加速库的安装 pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple pip install -U huggingface_hub pip install lemonade-sdk[dev]说明pip config set global.index-url ...将全局 PyPI 镜像切换为清华源后续安装均会加速huggingface_hub用于后续的模型下载lemonade-sdk[dev]是本文的核心依赖[dev]扩展包含开发调试所需的完整组件含 Lemonade 的 Python API 与工具模块如lemonade.api、lemonade.tools。3. 模型下载3.1 配置 Hugging Face 镜像站在国内网络环境下先配置 HF 镜像站以加速下载。在 Windows PowerShell 下输入$env:HF_ENDPOINT https://hf-mirror.com3.2 编写模型下载脚本使用huggingface_hub中的snapshot_download函数下载模型第一个参数为模型名称参数local_dir为模型的本地保存路径resume_download支持断点续传。新建model_download.py文件并输入以下内容粘贴后请及时保存#!/usr/bin/env python 使用 Python API 下载 Hugging Face 模型 import os from huggingface_hub import snapshot_download def download_model(repo_id: str, local_dir: str None, resume_download: bool True): 下载 Hugging Face 模型 Args: repo_id: 模型仓库ID例如 amd/Qwen3-8B-awq-quant-onnx-hybrid local_dir: 本地保存目录如果为None则使用默认缓存目录 resume_download: 是否支持断点续传 print(f开始下载模型: {repo_id}) print(f保存位置: {local_dir if local_dir else 默认缓存目录}) try: # 如果指定了本地目录使用它否则使用默认缓存 if local_dir: cache_dir os.path.dirname(local_dir) if os.path.dirname(local_dir) else None local_dir_use local_dir else: cache_dir None local_dir_use None # 下载模型 downloaded_path snapshot_download( repo_idrepo_id, local_dirlocal_dir_use, cache_dircache_dir, resume_downloadresume_download, local_files_onlyFalse ) print(f\n✓ 模型下载完成) print(f保存路径: {downloaded_path}) return downloaded_path except Exception as e: print(f\n✗ 下载失败: {str(e)}) raise if __name__ __main__: import sys # 默认下载的模型 repo_id amd/Qwen3-8B-awq-quant-onnx-hybrid # 如果提供了命令行参数使用它作为模型ID if len(sys.argv) 1: repo_id sys.argv[1] # 可选指定本地保存目录 local_dir None if len(sys.argv) 2: local_dir sys.argv[2] download_model(repo_id, local_dir)脚本要点解读默认模型amd/Qwen3-8B-awq-quant-onnx-hybrid从仓库命名可以看出这是 AMD 官方为 Ryzen AI 平台发布的AWQ 量化 ONNX Hybrid混合执行版本量化可显著降低内存占用Hybrid 表示可在 CPU/NPU 间混合调度命令行参数支持通过sys.argv覆盖默认模型 ID 与保存目录便于复用下载其他模型断点续传resume_downloadTrue保证网络中断后可以断点续传避免大模型重复下载。3.3 执行下载在终端运行以下命令执行下载python download_model.py amd/Qwen3-8B-awq-quant-onnx-hybrid C:\Users\aup\.cache\huggingface\hub\models--amd--Qwen3-8B-awq-quant-onnx-hybrid其中第二个参数即为模型的本地缓存目录请替换为实际用户名路径。下载完成后会输出✓ 模型下载完成与保存路径。4. 启动服务下载完成后即可启动推理服务在系统菜单栏托盘区域搜索Lemonade Server并启动点击菜单中对应的图标在 Lemonade 的 Model Manager 中选中已下载的Qwen3-8B-Hybrid模型即可启动服务启动后可对外输出兼容 OpenAI 格式的服务接口如上图所示Lemonade 主界面左侧 Model Manager 按推理引擎分类展示可用模型右上角可切换推理引擎与设备如 ONNX Runtime CPU/Hybrid/NPU、llama.cpp GPU 等右侧 LLM Chat 可直接进行对话验证底部 Server Logs 实时展示 API 请求日志如GET /api/v1/health返回 200。5. 服务测试OpenAI 兼容接口Lemonade Server 默认监听http://localhost:8000其/api/v1/chat/completions端点与 OpenAI Chat Completions 接口格式一致。新建test.py文件并输入以下内容以下代码有很详细的注释粘贴后请及时保存#!/usr/bin/env python 简洁版本的 API 测试脚本 完全模仿 curl 请求 import requests # 发送 POST 请求完全对应 curl 命令 response requests.post( http://localhost:8000/api/v1/chat/completions, headers{Content-Type: application/json}, json{ model: Qwen3-8B-Hybrid, messages: [{role: user, content: Hello!}] } ) # 打印响应 print(fStatus: {response.status_code}) print(fResponse: {response.json()})请求体中model字段需与 Lemonade 中加载的模型名一致此处为Qwen3-8B-Hybridmessages为 OpenAI 风格的多轮对话列表。运行python test.py返回结果如下从返回的 JSON 可以看到完整标准字段choices[0].message.content为模型生成内容如Hello! How can I assist you today?usage中给出了prompt_tokens、total_tokens等用量信息model字段标识为models-amd-qwen3-8B-awq-onnx-hybrid证明 NPU/Hybrid 推理链路已正常工作。可选使用 OpenAI SDK 客户端测试。Lemonade 的接口完全兼容 OpenAI 协议仓库中 gemma3 模型服务部署 提供了等价的 SDK 客户端写法可直接套用于 Qwen3-8Bfrom openai import OpenAI # base_url 指向本地 LLM 服务器localhost或云端地址 base_url fhttp://localhost:8000/api/v1 # client 实例提供向服务器发起 LLM 请求的 API client OpenAI( base_urlbase_url, api_keylemonade, # 必填参数Lemonade 中不实际校验 ) # messages 列表提供 system / assistant / user 角色的历史消息 messages [ {role: system, content: You are a helpful assistant.}, {role: user, content: Hi, how are you?}, ] # 发送消息历史到服务器的指定模型返回 completion completion client.chat.completions.create( modelQwen3-8B-Hybrid, messagesmessages, ) # 取模型回复并打印 response completion.choices[0].message.content print(response)6. 使用 Lemonade API 构建自建服务除了使用 Lemonade Server 的图形化界面还可以直接调用Lemonade 的 Python API构建自己的 API 服务将 Qwen3-8B 的能力封装给其他应用调用。新建api.py文件并输入以下内容from fastapi import FastAPI, Request from contextlib import asynccontextmanager from threading import Thread, Event from transformers import StoppingCriteriaList from lemonade.tools.server.serve import StopOnEvent from lemonade.api import from_pretrained from lemonade.tools.oga.utils import OrtGenaiStreamer import uvicorn import json import datetime import logging import queue import uuid import asyncio # 配置日志 logging.basicConfig(levellogging.INFO) logger logging.getLogger(__name__) # 全局模型变量 model None tokenizer None # 任务队列和结果字典 task_queue queue.Queue() result_dict {} worker_thread None worker_running False # --- 模型加载逻辑 --- def load_models(): global model, tokenizer try: logger.info(正在加载模型...) model, tokenizer from_pretrained( amd/Qwen3-8B-awq-quant-onnx-hybrid, recipeoga-hybrid, ) logger.info(模型加载完成) except Exception as e: logger.error(f模型加载失败: {str(e)}) raise # --- 工作线程函数 --- def worker_thread_func(): 长期运行的工作线程从队列中获取任务并处理 global model, tokenizer, task_queue, result_dict, worker_running logger.info(工作线程已启动) worker_running True while worker_running: try: # 从队列中获取任务阻塞等待 task task_queue.get(timeout1.0) if task is None: # 收到停止信号 break task_id, prompt_text, max_new_tokens task try: # 使用 chat.py 中的推理方式 input_ids tokenizer(prompt_text, return_tensorspt).input_ids # 使用流式生成器收集完整响应 streamer OrtGenaiStreamer(tokenizer) stop_event Event() stopping_criteria StoppingCriteriaList([StopOnEvent(stop_event)]) generation_kwargs { input_ids: input_ids, streamer: streamer, max_new_tokens: max_new_tokens, stopping_criteria: stopping_criteria, } # 在工作线程中创建子线程来运行 generate # streamer 需要在另一个线程中读取而 generate 在子线程中运行 generate_thread Thread(targetmodel.generate, kwargsgeneration_kwargs) generate_thread.start() # 在工作线程中收集完整响应从 streamer 读取 response for new_text in streamer: response new_text # 等待生成线程完成 generate_thread.join() # 将结果存入结果字典 result_dict[task_id] { success: True, response: response } except Exception as e: logger.error(f处理任务 {task_id} 时出错: {str(e)}) result_dict[task_id] { success: False, error: str(e) } # 标记任务完成 task_queue.task_done() except queue.Empty: # 队列为空继续循环 continue except Exception as e: logger.error(f工作线程错误: {str(e)}) continue logger.info(工作线程已停止) # --- FastAPI应用 --- asynccontextmanager async def lifespan(app: FastAPI): global worker_thread, worker_running try: load_models() # 启动工作线程 worker_thread Thread(targetworker_thread_func, daemonTrue) worker_thread.start() logger.info(工作线程已启动) yield except Exception as e: logger.error(f服务初始化失败: {str(e)}) raise finally: # 停止工作线程 worker_running False if worker_thread and worker_thread.is_alive(): task_queue.put(None) # 发送停止信号 worker_thread.join(timeout5) logger.info(工作线程已停止) app FastAPI(lifespanlifespan) # 处理POST请求的端点 app.post(/) async def create_item(request: Request): global task_queue, result_dict # 声明全局变量 json_post_raw await request.json() # 获取POST请求的JSON数据 json_post json.dumps(json_post_raw) # 将JSON数据转换为字符串 json_post_list json.loads(json_post) # 将字符串转换为Python对象 prompt json_post_list.get(prompt) # 获取请求中的提示 history json_post_list.get(history, []) # 获取请求中的历史记录 max_new_tokens json_post_list.get(max_new_tokens, 1024) # 获取最大token数默认1024 # 构建提示文本处理历史记录 if history: conversation_text for item in history: if isinstance(item, list) and len(item) 2: user_msg, assistant_msg item conversation_text fUser: {user_msg}\nAssistant: {assistant_msg}\n prompt_text f{conversation_text}User: {prompt}\nAssistant: else: prompt_text prompt try: # 生成唯一任务ID task_id str(uuid.uuid4()) # 将任务放入队列 task_queue.put((task_id, prompt_text, max_new_tokens)) logger.info(f任务 {task_id} 已加入队列) # 等待结果轮询检查结果字典 max_wait_time 300 # 最大等待时间秒 wait_interval 0.1 # 轮询间隔秒 elapsed_time 0 while task_id not in result_dict: if elapsed_time max_wait_time: raise TimeoutError(f任务 {task_id} 超时) await asyncio.sleep(wait_interval) elapsed_time wait_interval # 获取结果 result result_dict.pop(task_id) if result[success]: response result[response] now datetime.datetime.now() # 获取当前时间 time now.strftime(%Y-%m-%d %H:%M:%S) # 格式化时间为字符串 # 构建响应JSON answer { response: response, status: 200, time: time } # 构建日志信息 log [ time ] , prompt: prompt_text , response: repr(response) logger.info(log) # 打印日志 return answer # 返回响应 else: raise Exception(result.get(error, 未知错误)) except Exception as e: logger.error(f处理请求时出错: {str(e)}) now datetime.datetime.now() time now.strftime(%Y-%m-%d %H:%M:%S) return { response: f错误: {str(e)}, status: 500, time: time } # 主函数入口 if __name__ __main__: # 模型加载在 lifespan 中自动完成 # 启动FastAPI应用 # 用6006端口可以将autodl的端口映射到本地从而在本地使用api uvicorn.run(app, host0.0.0.0, port6006, workers1) # 在指定端口和主机上启动应用该服务由以下五个核心模块构成逐一拆解如下① 模型加载from_pretrained与recipemodel, tokenizer from_pretrained( amd/Qwen3-8B-awq-quant-onnx-hybrid, recipeoga-hybrid, )lemonade.api.from_pretrained是 Lemonade 的模型加载入口第一个参数为模型仓库 IDrecipe参数指定推理配方。从文档代码可见此处使用oga-hybrid——oga对应 ONNX GenAI 推理引擎hybrid对应 CPU/NPU 混合执行模式这与 Lemonade 安装页面中展示的推理引擎选项OGA、llama.cpp、FastFlowLM与设备选项NPU、Hybrid、GPU、CPU一一对应。② 并发模型任务队列 工作线程Lemonade 的模型generate是阻塞式调用直接放在 FastAPI 的异步端点中会阻塞事件循环。该服务采用生产者-消费者架构task_queue保存待处理请求worker_thread_func常驻后台消费任务result_dict以task_id为键暂存结果HTTP 端点轮询取回。这套结构让单个模型实例可以稳定处理并发请求且模型只加载一次放在 FastAPI 的lifespan生命周期中启动/关闭时自动完成资源管理。③ 流式生成OrtGenaiStreamerStopOnEventstreamer OrtGenaiStreamer(tokenizer) stop_event Event() stopping_criteria StoppingCriteriaList([StopOnEvent(stop_event)]) generation_kwargs { input_ids: input_ids, streamer: streamer, max_new_tokens: max_new_tokens, stopping_criteria: stopping_criteria, } generate_thread Thread(targetmodel.generate, kwargsgeneration_kwargs) generate_thread.start() response for new_text in streamer: response new_text generate_thread.join()OrtGenaiStreamer来自lemonade.tools.oga.utils是 ONNX GenAI 引擎的流式 token 生成器配合标准transformers的StoppingCriteriaList自定义的StopOnEvent停止条件控制生成结束由于streamer需要边生成边读取而generate本身阻塞运行代码将model.generate放到子线程执行主工作线程从streamer迭代收集增量文本最终拼接为完整回复——这正是api.py中generate 在子线程、streamer 在主线程读取设计的原因。④ 请求端点POST /端点接收 JSON 请求体支持三个字段字段类型默认值说明promptstr必填当前用户输入historylist[]历史对话每项为[user_msg, assistant_msg]二元组服务端自动拼装为User: ...\nAssistant: ...格式max_new_tokensint1024生成的最大新 token 数⑤ 服务启动uvicorn.run(app, host0.0.0.0, port6006, workers1)以0.0.0.0绑定全部网卡、监听6006端口启动workers1保证单实例模型不被多进程重复加载模型本身在lifespan中全局加载一次。端口可按需修改文档注释还提到用 6006 端口可以将 AutoDL 的端口映射到本地即该端口可配合远程主机的端口映射在本地访问。7. 从调用链看 Lemonade 的关键模块从api.py与test.py的导入语句可以梳理出 Lemonade SDK 为开发者暴露的核心能力以下均为文档代码中直接可见的导入路径模块导入职责出现位置from lemonade.api import from_pretrained按仓库 ID recipe 加载模型与 tokenizermodels_amd/qwen3/1-Qwen3-8B-AMD部署调用.mdfrom lemonade.tools.server.serve import StopOnEvent自定义停止条件配合transformers停止生成同上from lemonade.tools.oga.utils import OrtGenaiStreamerONNX GenAI 引擎的流式生成器同上lemonade-server图形化菜单栏/托盘启动对外暴露 OpenAI 兼容的8000端口同上由此可以推断 Lemonade 的架构分层lemonade.api提供高层模型加载接口 →lemonade.tools.oga封装 ONNX GenAI 推理引擎含流式工具→lemonade.tools.server提供服务端组件。图形化 Lemonade Server 与api.py底层共享同一套推理栈因此两者的模型行为、停止条件与 OpenAI 兼容输出格式保持一致开发者既可以用图形界面快速验证也可以用 Python API 深度集成。仓库中 gemma3 模型服务部署 使用了完全相同的 Lemonade 部署与测试模式可作为本方案的交叉印证。8. 硬件平台支持与通用配置从 AMD 平台支持模型列表 可以获取本系列教程的通用约束系统要求操作系统Windows 11 64-bit推荐Linux Ubuntu 20.04部分支持硬件AMD Ryzen AI 300 系列或更新处理器最低 16GB 内存、推荐 32GB存储预留 50GB 以上驱动AMD Ryzen AI NPU 驱动含 MCDM 驱动 AMD Software: Adrenalin Edition。Python 环境通用配置conda create -n amd_llm python3.9 conda activate amd_llm pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple性能优化建议来自仓库文档内存优化利用统一内存架构合理分配系统内存与显存大模型建议 32GB 内存配置NPU 加速在支持的硬件上启用 NPU 推理加速使用 lemonade-server SDK 获得最佳性能模型量化使用 INT4/INT8 量化本文的amd/Qwen3-8B-awq-quant-onnx-hybrid即为 AWQ 量化版本减少内存占用在保证精度的前提下提升推理速度。9. 常见问题与排查Q如何检查 AMD 设备是否被正确识别# 检查 NPU 设备Lemonade 环境内 python -c import lemonade; print(lemonade.get_device_info()) # 检查 GPU 设备ROCm / Linux 环境 rocm-smiQNPU 不可用 / 模型无法加载到 NPU确认 NPU MCDM 驱动版本满足要求32.0.203.280 或更新并在任务管理器 → 性能 → NPU0 中确认设备可见确认已安装 Ryzen AI 软件ryzenai-lt-1.6.1并已通过quicktest.py验证确认使用的是amd/Qwen3-8B-awq-quant-onnx-hybridHybrid 版并搭配recipeoga-hybrid加载。Q模型下载失败或速度慢在 PowerShell 中设置$env:HF_ENDPOINT https://hf-mirror.com使用镜像站下载脚本已开启resume_downloadTrue断点续传网络中断后重跑即可继续可先执行python -m pip install --upgrade pip并确认已换用清华 PyPI 源。Q测试接口返回 404 / 连接拒绝确认 Lemonade Server 已在托盘菜单启动且模型已加载Model Manager 中可看到 Qwen3-8B-Hybrid确认请求端口为8000Lemonade Server 默认或自建服务的6006确认model字段名与界面中显示的模型名完全一致。10. 总结本文完整覆盖了 Qwen3-8B 在 AMD Ryzen AI 300 系列平台上的 Lemonade 部署链路环境准备NPU 驱动 Ryzen AI 软件 lemonade-sdk[dev]模型下载HF 镜像 snapshot_downloadAWQ 量化 Hybrid 版amd/Qwen3-8B-awq-quant-onnx-hybrid图形化启动Lemonade Server 托盘启动、选中模型即可对外提供 OpenAI 兼容接口接口测试requests/openaiSDK 直接调用chat/completions自建服务基于from_pretrainedOrtGenaiStreamer 任务队列 FastAPI 封装的高可用 API 服务。这套方案的价值在于无需任何独立 GPU 与 CUDA 环境一台 Windows 11 的 Ryzen AI 笔记本即可本地运行 8B 级量化大模型且提供与 OpenAI 完全兼容的标准接口可无缝接入 LangChain、OpenWebUI 等生态。相关配套资料可在仓库中继续查阅Qwen3-8B AMD 部署调用文档、AMD 环境准备指南、AMD 平台支持模型列表。【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门