腾讯混元 Hy4 preview 实测:770B MoE 扛 1M 上下文,盲测 2.99 压过 GLM/Kimi,自部署却要 8×B300
一、模型速览Hy4 preview 是腾讯混元团队首席 AI 科学家姚顺雨带队2026 年 8 月 28 日开源的新一代 MoE 旗舰距 Hy3 GA 仅约八周也是首个官方称参与了自身训练与推理基础设施优化的混元模型。项目规格发布方腾讯混元首席 AI 科学家姚顺雨团队总 / 激活参数770B / 49B每 token 激活约 6.4%上下文1,048,576 tokens原生 1M许可证Apache 2.0可商用无营收门槛模态纯文本开源权重 text-only未见官方视觉/音频变体待验证架构MoE78 层256 路由专家 1 共享专家top-8 激活定位数据中心级生产力旗舰面向长上下文 coding / 办公 / 科研一句话定位一款需要 8 卡数据中心才能自部署、但 API 价格却比 GLM/Kimi 便宜的 1M 上下文开源 MoE 旗舰。二、核心亮点1. Gated DSA IndexCache1M 上下文的稀疏注意力注意力采用 Gated DeepSeek Sparse AttentionGated DSA配跨层稀疏索引复用IndexCache与 4 条 iHC 残差流。这让 1M 上下文在显存与计算上可控而非简单堆全注意力。2. 原生 MTP 草稿层投机解码提速模型自带 10B 总参 / 0.7B 激活的 MTP 层用于投机解码。配合 vLLM / SGLang 的 MTP 配置可在不损分布的前提下提升吞吐。3. 帮自己优化的递归自改进闭环Tencent 称 Hy4 参与了自身训练方法、数据策略、评估与底层算子优化并自主分析推理瓶颈、做算子融合与通信优化端到端吞吐较基线提升31.8%内部结果。这是官方重点强调的差异化故事。4. 内部盲测小胜 GLM-5.3 与 Kimi K3163 名专家对 203 个工程任务的盲测Hy4 preview2.99/4GLM-5.3 2.9246.8% 胜 / 12.8% 平 / 40.4% 负Kimi K3 2.9451.2% 胜 / 7.9% 平 / 40.9% 负。注意差距不到 0.1 分胜率接近抛硬币——官方自述略胜。三、部署3.1 硬件现实这不是消费级模型版本权重体积最低硬件BF16~1,848 GB16×B200 或 8×B300MXFP8~924 GB8×B200/B300tensor-parallel 8Q4社区~450–512 GB512GB 内存性能受限⚠️ 避坑提醒单张 8×H100 节点640GB装不下FP8 版。官方 recipe 最低 16×B200 或 8×B300。对绝大多数团队用云 API 比自建 GPU 集群划算得多。3.2 自部署vLLM / SGLang官方镜像官方提供预构建镜像8 卡 FP8 启动bash # vLLM官方镜像 vllm/vllm-openai:hy4-preview docker run --gpus all -p 8000:8000 --ipchost \ -v ~/.cache/huggingface:/root/.cache/huggingface \ vllm/vllm-openai:hy4-preview \ tencent/Hy4-preview-FP8 \ --tensor-parallel-size 8 \ --speculative-config {num_speculative_tokens:3,method:mtp} \ --attention-backend FLASHMLA_SPARSE \ --tool-call-parser hy_v4 --reasoning-parser hy_v4 \ --enable-auto-tool-choice --port 8000 \ --served-model-name hy4-preview # SGLang官方镜像 lmsysorg/sglang:hy4-preview支持 x86 / Arm docker run --gpus all --ipchost -p 8000:8000 \ lmsysorg/sglang:hy4-preview \ python3 -m sglang.launch_server \ --model tencent/Hy4-preview-FP8 --tp-size 8 \ --reasoning-parser auto --tool-call-parser auto \ --speculative-algorithm NEXTN --speculative-num-steps 3 \ --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 \ --port 8000 --served-model-name hy4-preview3.3 调用服务OpenAI 兼容from openai import OpenAI client OpenAI(base_urlhttp://127.0.0.1:8000/v1, api_keyEMPTY) resp client.chat.completions.create( modelhy4-preview, messages[{role: user, content: 用 FastAPI 写一个带鉴权的文件上传接口。}], temperature0.9, top_p1.0, ) print(resp.choices[0].message.content)默认开启深度推理high。简单任务想直接拿答案在extra_body加{chat_template_kwargs: {reasoning_effort: no_think}}。3.4 没 8 卡走 API大多数团队的路径通过腾讯云 TokenHub 或 OpenRouter 调用模型 IDhy4-previewOpenRouter:tencent/hy4-preview。OpenRouter 带零数据留存策略。WorkBuddy / CodeBuddy 发布后两周限时免费。# OpenRouter 调用示例curl curl https://openrouter.ai/api/v1/chat/completions \ -H Authorization: Bearer $OPENROUTER_API_KEY \ -H Content-Type: application/json \ -d {model:tencent/hy4-preview,messages:[{role:user,content:Hello}],max_tokens:512}四、性能测评4.1 速度与成本官方 / 社区指标数值来源自部署吞吐提升31.8%端到端vs 基线腾讯内部非独立复测OpenRouter P50 延迟2.75s约 38 tok/sOpenRouter 实测freeai.helpAPI 输入价$0.834 / 百万 token腾讯云 / OpenRouterAPI 输出价$2.501 / 百万 token腾讯云 / OpenRouter缓存命中价$0.042 / 百万 token腾讯云 / OpenRouter国内价¥6 输入 / ¥18 输出 / ¥0.3 缓存命中腾讯云注自部署吞吐与延迟均为官方/平台数据未在本文独立复测。4.2 生成质量引用官方 model card最高推理档工程 / Agent主战场SWE-bench Pro65.7Hy3 57.9、Terminal-Bench 2.185.4Hy3 70.8、DeepSWE64.3、Toolathlon-Verified74.1、MCP-Atlas83.7、SWE-bench Multilingual82.9。推理 / 通用GPQA Diamond92.3、HLE(no-tools)43.4、MathArena Apex 202574.2。局限在 SWE-Marathon31.9 vs Opus 5 的 50.0、ProgramBench17.5 vs 39.5上明显落后于 Claude Opus 5。4.3 同档模型对比表维度Hy4 previewGLM-5.3Kimi K3DeepSeek V4 Flash总参/激活770B/49B未披露2.8T/104B284B/13B上下文1MN/A1M1M专家盲测2.992.922.94—SWE-bench Pro65.7未披露未披露未披露Terminal-Bench 2.185.4———API 输出价 $/M2.5014.4015.000.66自部署门槛8×B300待验证数据中心级待验证结论Hy4 preview 在旗舰开源里 API 价格相对便宜缓存命中0.042/M 极低工程类基准与 GLM-5.3、Kimi K3 大致持平但相比 DeepSeek V4 Flash输出0.66/M贵约 4 倍且自部署硬件门槛远超消费级。预算敏感的高频简单任务Flash 更经济。五、使用建议适用场景企业级长上下文代码库分析、跨文件重构、多文件综合长周期 Agent 任务需要强规划与工具调用办公分析跨文档协作、金融建模、报表生成科研分子动力学、凝聚态物理、基础数学见官方几何/量子输运案例需 Apache 2.0 无限制条款的商用项目。不适用场景需要多模态/视觉输入当前开源权重为纯文本——待验证是否有视觉变体个人本地部署硬件门槛远超消费级对延迟极敏感默认深度推理 过度验证交付偏慢预算有限的高频简单任务 → 选 DeepSeek V4 Flash / GLM-5.3-Flash。调优提示关深度推理简单任务传reasoning_effort: no_think交付时长明显下降吃缓存红利反复读同一长上下文代码库/长文档的工作负载缓存命中 $0.042/M 是真省钱点自部署用 FP8 MTPtensor-parallel 8开投机解码用 AngelSlim 做进一步压缩成本预期Hy4 比 Hy3 贵约 5–6 倍老 Hy3 用户需重新算账。你会为了 1M 上下文和工程能力接受 Hy4 preview 比 Hy3 贵 5–6 倍、且基本只能走 API 的现实吗还是更倾向本地能跑的小模型数据来源说明本文数据来自腾讯混元官方发布、Hugging Face model cardtencent/Hy4-preview、vLLM/SGLang 官方 recipe、OpenRouter 定价页以及 miraflow / letsdatascience / brocker / labindex / eesel.ai / freeai.help 等第三方分析。基准多为厂商发布值自部署吞吐为内部结果未独立复测以独立第三方评测为准。关于多模态部分早期报道称 Hy4 多模态但官方 model card 与 recipe 均为 text-only本文以官方为准并标注待验证。往期回顾Apodex-1.1-mini 部署实测Int4 量化 18GB 单卡跑通 Agent Team35B 开源逼近 1T KimiQwen3.8-27B GSQ-RCO 量化部署实测9.3GB 跑出超 BF16 精度消费级显卡落地 27B 多模态SenseNova U1.5 Lite 部署实测8B 单卡跑通 4K 生图Apache 2.0 免费商用