拓冰建站拓冰建站
首页 / 资讯中心 / 正文

如何快速上手InternVL3_5-4B-HF:从模型下载到首次图文对话的完整新手教程

如何快速上手InternVL3_5-4B-HF从模型下载到首次图文对话的完整新手教程【免费下载链接】InternVL3_5-4B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HFInternVL3_5-4B-HF是上海AI Lab开源的InternVL3.5 系列多模态大模型的 HuggingFace 标准格式版本总参数 4.7B。它原生支持图文对话、视频理解与思维模式推理无需自定义代码用官方 transformers 即可直接加载推理是新手入门开源多模态大模型MLLM的理想选择。本教程带你从零开始下载权重 → 配置环境 → 完成第一次图文对话全程约 15 分钟 ⏱️。一、模型亮点为什么选 InternVL3_5-4B-HFInternVL3.5 采用ViT–MLP–LLM架构视觉编码器为 InternViT-300M语言模型基于Qwen3-4B。相比前代 InternVL3推理性能最高提升 16%推理速度提升 4.05 倍并新增 GUI 交互、具身智能等能力。项目说明参数量视觉 0.3B 语言 4.4B共 4.7B上下文长度32K最大 40960 token精度bfloat16原生格式HuggingFace 标准格式transformers 直接加载授权Apache-2.0可免费商用硬件需求单张 12GB 以上显卡即可8GB 显卡可 8-bit 量化运行 HF 格式是官方 Transformers 标准API 与社区生态完全兼容后续可无缝接入 LMDeploy、vLLM 部署。二、模型下载一条命令获取完整权重在目标目录下执行以下命令即可下载全部模型权重约 10GBgit clone https://gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HF下载完成后目录中的关键文件如下建议对照检查是否完整 ✅文件作用model-00001-of-00002.safetensors、model-00002-of-00002.safetensors模型权重分两个分片存储model.safetensors.index.json权重分片索引config.json模型结构配置视觉/语言双编码器参数tokenizer.json、vocab.json、merges.txt分词器与词表preprocessor_config.json图像预处理配置动态高分辨率切片参数video_preprocessor_config.json视频帧预处理配置chat_template.jinja对话模板图文消息自动拼接generation_config.json默认生成参数bos/eos tokenexamples/官方示例素材image1.jpg、image2.jpg、red-panda.mp4三、环境准备最快配置方法只需安装 PyTorch 与 transformers无需任何自定义代码库pip install torch transformers4.52.1⚠️ 版本要求请确保transformers 4.52.1模型自带配置为 4.55.0版本过低会直接报错无法加载。显卡建议12GB 及以上显存直接以 bfloat16 精度加载效果最佳8GB 显存加载时加load_in_8bitTrue做 8-bit 量化显存占用约减半显存不够/多卡加device_mapauto自动切分到多张卡。四、首次图文对话描述官方示例中的小熊猫仓库自带的examples/image1.jpg是一张官方示例图正好用来做第一次图文对话完整推理代码如下加载模型 图文对话共 20 行以内import torch from PIL import Image from transformers import AutoProcessor, AutoModelForImageTextToText model_path InternVL3_5-4B-HF # clone 得到的目录 processor AutoProcessor.from_pretrained(model_path) model AutoModelForImageTextToText.from_pretrained( model_path, torch_dtypetorch.bfloat16, low_cpu_mem_usageTrue, device_mapauto, # 显存不足时保留显存充足可删除 ).eval() messages [{ role: user, content: [ {type: image, image: Image.open(examples/image1.jpg)}, {type: text, text: 请描述一下这张图片并说出图中的动物}, ], }] conversation processor.apply_chat_template( messages, add_generation_promptTrue, tokenizeFalse) inputs processor([conversation], images[Image.open(examples/image1.jpg)], return_tensorspt).to(model.device) output model.generate(**inputs, max_new_tokens512, do_sampleFalse) print(processor.decode(output[0][inputs[input_ids].shape[-1]:], skip_special_tokensTrue))运行后模型会识别出图中的红熊猫小熊猫并描述它趴在木板上、背景是树木枝叶的场景 。验证成功的 3 个信号终端出现下载权重后的加载进度无KeyError/ImportError输出一段连贯的中文或英文图像描述描述中准确提到小熊猫/红熊猫及木桌等关键物体。五、进阶玩法思维模式与视频理解1. 开启思维模式Thinking ModeInternVL3.5 支持先思考、后回答的深度推理。只需在对话中加一条 system 消息引导模型在think标签内逐步分析并建议设置do_sampleTrue, temperature0.6避免输出重复messages [ {role: system, content: [ {type: text, text: You are an AI assistant that rigorously follows this response protocol: ...官方 R1_SYSTEM_PROMPT}]}, {role: user, content: [ {type: image, image: img}, {type: text, text: 这张图里的动物有几只}]}, ]2. 视频理解examples/red-panda.mp4配合同目录的video_preprocessor_config.json即可让模型看视频。将消息中的type: image换成type: video传入视频帧序列模型即可回答视频内容相关问题对话模板chat_template.jinja已内置video占位符无需手写。六、新手常见问题FAQQ1加载时报错Image file config.json cannot be found或架构不识别Atransformers 版本过低升级到pip install -U transformers≥ 4.52.1即可。Q2显存不足OOM 了怎么办A三招任选——① 加load_in_8bitTrue需安装bitsandbytes② 显存充足时去掉device_mapauto让模型完整进 GPU③ 输入图片分辨率调低preprocessor_config.json中min_patches1、max_patches12动态高分辨率会自动控制 token 数量一般无需手动干预。Q3可以商用吗A可以。项目采用 Apache-2.0 协议模型组件 Qwen3 同为 Apache-2.0。Q4之后想部署成在线服务A权重为 HF 标准格式可直接用 LMDeploypip install lmdeploy0.9.1或 vLLM 一键部署为兼容 OpenAI 接口的 API 服务4B 版本单卡 A100/4090 即可承载。七、总结用3 步你就完成了 InternVL3_5-4B-HF 的从零上手下载git clone拿到完整权重约 10GB环境transformers 4.52.1 PyTorch无需自定义代码对话AutoProcessorAutoModelForImageTextToText加载即可描述图片、理解视频、开启思维模式。接下来可以试试多轮图像对话、把examples/image2.jpg加进同一轮对话做多图比较或用 LMDeploy 把它部署成 OpenAI 兼容的 API 服务。祝玩得开心 【免费下载链接】InternVL3_5-4B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门