Qwen3.8-27B-FP8模型亮点多,基准测试表现出色,使用方法大揭秘!
【Hugging Face导航介绍】有Hugging Face标志其导航栏包含模型、数据集、空间、存储桶新、文档、企业版、定价等选项。网站部分有任务、HuggingChat、集合、语言、组织社区部分有博客、帖子、每日论文、硬件、学习、Discord、论坛、GitHub解决方案部分有团队与企业版、Hugging Face PRO、企业支持、推理供应商、推理端点、存储桶。还有登录和注册选项。【Qwen相关模型展示】展示了Qwen和Qwen3.8 - 27B - FP8模型Qwen有97.1k关注Qwen3.8 - 27B - FP8点赞291。该模型涉及图像 - 文本转文本、Transformers、Safetensors、qwen3_5、对话式、fp8等许可证为apache - 2.0还有模型卡片、文件和社区等相关内容可进行部署、复制到存储桶、使用此模型等操作。【Qwen/Qwen3.8 - 27B - FP8使用说明】使用Qwen/Qwen3.8 - 27B - FP8可通过库、推理供应商、笔记本和本地应用程序。库方面如使用Transformers库有相应的代码示例包括使用管道作为高级助手和直接加载模型的方法。笔记本可选择Google Colab、Kaggle。本地应用程序有vLLM、SGLang、Docker模型运行器等且分别给出了使用这些本地应用程序的代码示例如从pip安装并运行模型、使用Docker等方式。【Qwen3.8 - 27B - FP8模型介绍】此仓库包含以Hugging Face Transformers格式存储的、经过微调的模型的FP8量化模型权重和配置文件与Hugging Face Transformers、vLLM、SGLang、TokenSpeed等兼容量化方法采用块大小为128的细粒度fp8量化性能指标与原始模型几乎相同。对于希望在无需维护基础设施的情况下进行托管、可扩展推理的用户可使用由Qwen云提供的官方Qwen API服务Qwen3.8 - 27B将以托管版本的形式提供具备更多生产特性如默认支持1M上下文长度、官方内置工具等。【Qwen3.8推出背景及优势】随着Qwen3.5和Qwen3.6系列在社区中得到广泛应用推出了Qwen3.8它是Qwen开源模型家族中目前功能最强大的一代。Qwen3.8基于Qwen3.5的架构基础构建在编码、专业工作、研究和长周期代理任务等方面都取得了显著提升。Qwen3.8 - 27B将这些优势融入到一个紧凑、易于部署的密集模型中是原生的视觉 - 语言模型能理解图像和视频具备灵活的思维控制能力旨在更可靠地完成复杂的多步骤任务。【Qwen3.8亮点】Qwen3.8 - 27B具有核心能力全面提升、代理执行能力更强、下游兼容性更广泛、灵活的思维控制、视觉 - 语言理解能力等增强特性。【模型概述】Qwen3.8 - 27B是带有视觉编码器的因果语言模型经过预训练和微调阶段。语言模型参数数量为270亿有隐藏维度、词嵌入、层数等相关参数上下文长度原生支持262,144个令牌可扩展至100万个令牌。【基准测试结果 - 文本性能】通过表格展示了Qwen3.8 - 27B与Qwen3.6 - 27B、Qwen3.7 - Plus、Muse Glimmer - 30B、Opus4.6 Max等模型在编码、代理、通用等方面的性能对比如在代理终端编码、代理编码、仓库级代码生成等多个测试项目中的表现。同时还给出了各测试项目的评估方式说明。【基准测试结果 - 视觉 - 语言性能】通过表格展示了Qwen3.8 - 27B与其他模型在代理多模态智能和通用多模态智能方面的性能对比如在计算机使用、浏览器使用、移动设备使用等多个测试项目中的表现也给出了各测试项目的评估方式说明。【快速开始 - 部署Qwen3.8】为实现更便捷的集成建议通过API使用Qwen3.8。不同框架的推理效率和吞吐量差异显著建议使用最新版本的框架对于生产工作负载或高吞吐量场景建议使用专门的服务引擎如SGLang、vLLM或TokenSpeed。Qwen3.8可使用流行的推理框架进行部署如SGLang、vLLM、TokenSpeed并给出了相应的操作手册或配方链接。【快速开始 - API使用方法】Qwen3.8模型默认处于思维模式若要禁用思维内容并直接获取响应有相应示例还建议使用特定的采样参数集。Qwen3.8官方支持reasoning_effort参数可调整推理深度和控制成本有xhigh、medium、low三个级别。所有工作负载默认启用preserve_thinking若要禁用也有相应示例说明。接着详细介绍了聊天完成API的使用包括仅文本输入、图像输入、视频输入、指令或非思维模式、禁用保留思维等不同情况的代码示例。【最佳实践】为实现最佳性能建议采用特定的采样参数集思维模式和指令或非思维模式有不同的参数设置。