拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Inkling-Small-mlx-2bit震撼发布:2640亿参数模型如何在96GB Mac上流畅运行?

Inkling-Small-mlx-2bit震撼发布2640亿参数模型如何在96GB Mac上流畅运行【免费下载链接】Inkling-Small-mlx-2bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Inkling-Small-mlx-2bitInkling-Small-mlx-2bit是一款基于MLX框架构建的2bit量化模型源自thinkingmachines/Inkling-Small具备2640亿总参数约120亿活跃参数支持图像音频输入、文本输出的多模态能力。其最大亮点在于能够完全驻留在96GB内存的Mac上运行无需专家卸载、修剪或层流技术整个模型可置于统一内存中并以对话速度解码。 突破硬件限制96GB Mac也能驾驭千亿模型传统大模型往往受限于硬件配置尤其是内存容量。而Inkling-Small-mlx-2bit采用创新的量化策略实现了在96GB Mac上的流畅运行。这一突破主要得益于以下几点精准量化分级专家层采用2bit量化非专家层注意力、令牌/输出嵌入、RMSNorms、路由门等保持8bit高精度。这种非对称量化既大幅降低了模型大小仅88.4GB磁盘占用又确保了关键路径的性能。统一内存架构依托Apple Silicon的统一内存设计GPU与CPU共享同一块DRAM88GB的模型仅需88GB系统内存无需额外VRAM避免了PCIe传输瓶颈。按需加载机制通过mlx的mx.load实现内存映射加载权重按需分页进入内存而非全部预加载显著降低了启动时的内存压力。 多版本选择总有一款适合你的Mac项目提供了多个量化版本以适应不同内存配置的Mac设备版本目标Mac内存量化方案磁盘大小4bit192GB专家4bit非专家8bit153.5GB3bit128GB专家3bit非专家8bit120.9GB2bit96GB专家2bit非专家8bit88.4GB提示实际使用时需为KV缓存和操作系统预留空间。对于96GB Mac建议通过sudo sysctl iogpu.wired_limit_mb180000命令调整Metal wired限制避免进程被系统终止。 MLX框架Apple Silicon的AI利器Inkling-Small-mlx-2bit之所以能在Mac上高效运行MLX框架功不可没。其核心优势包括原生量化矩阵乘法量化权重以压缩形式直接参与计算quantized_matmul、gather_qmm runtime时节省带宽而非仅在存储时。按模块精度控制通过nn.quantize(..., class_predicate...)实现不同张量类别的混合精度关键模块保持高精度。精简依赖仅需pip install mlx mlx-lm即可运行无需编译步骤或独立服务器二进制文件。 快速上手三步运行模型1. 安装依赖pip install mlx mlx-lm transformers # 如需处理音频和图像需额外安装scipy和pillow2. 克隆仓库git clone https://gitcode.com/hf_mirrors/mlx-community/Inkling-Small-mlx-2bit cd Inkling-Small-mlx-2bit3. 运行示例代码from inkling_mlx.load import load from inkling_mlx.generate import greedy_generate from transformers import AutoTokenizer path ./Inkling-Small-mlx-2bit model, config load(path) tok AutoTokenizer.from_pretrained(path, trust_remote_codeTrue) ids tok(The capital of France is)[input_ids] print(tok.decode(greedy_generate(model, config, ids, max_new_tokens64))) 性能测试通过以下命令可测试模型加载时间、预填充速度、不同上下文长度下的解码速度及峰值内存python serving/bench_mlx.py --model ./Inkling-Small-mlx-2bit --tier 2bit 适用场景与注意事项Inkling-Small-mlx-2bit特别适合需要在Mac上进行本地多模态处理的场景如图像描述生成、音频转文本等。其InklingProcessor支持将图像切割为40px补丁每个对应一个软令牌音频以20 tokens/s的速度进行d-mel编码。注意MLX生态系统相对较新暂不支持i-quant风格的校准量化且仅能在Apple Silicon上运行。若需GGUF格式可参考unsloth/Inkling-Small-GGUF。 项目致谢基础模型thinkingmachines/Inkling-SmallApache-2.0许可加载器PipeNetwork/inkling-mlxApache-2.0许可量化工具mlx框架通过创新的量化技术和对Apple Silicon的深度优化Inkling-Small-mlx-2bit为Mac用户带来了前所未有的大模型本地运行体验。无论你是开发者、研究者还是AI爱好者都可以尝试这款模型探索本地多模态AI的无限可能【免费下载链接】Inkling-Small-mlx-2bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Inkling-Small-mlx-2bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门