拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Bonsai-demo 8B/4B/1.7B小模型使用指南:轻量场景最佳实践

Bonsai-demo 8B/4B/1.7B小模型使用指南轻量场景最佳实践【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demoBonsai-demo 是 PrismML 开源的本地小模型推理演示项目一条命令即可在 Mac、Linux、Windows 上跑起Bonsai 8B / 4B / 1.7B轻量语言模型1-bit 与 Ternary 两个家族无需显卡也能流畅对话是离线聊天、嵌入式与低配电脑场景的最佳实践方案。上图是社区整理的模型效率对比Bonsai 1.7B / 4B / 8B 在每 GB 模型体积能换来多少平均基准分数这条曲线上明显领先 Qwen3、Ministral3 等同尺寸开源模型——这正是它值得上手的原因。小模型 vs 27B该选哪个项目默认下载的是 27B带视觉、工具调用、推理与 256k 长上下文。而8B / 4B / 1.7B 是纯文本模型胜在极致的轻小规格1-bit 量化体积适合场景Bonsai-8B约 1.1 GiB日常问答、写作辅助16 GB 内存即可Bonsai-4B约 540 MiB嵌入式设备、低配笔记本8 GB 内存Bonsai-1.7B约 231 MiB超老电脑 / 纯 CPU 极速对话4 GB 内存两个模型家族用BONSAI_FAMILY切换ternaryTernary-Bonsai2-bit质量更高默认与bonsai1-bit文件最小、速度最快。完整变量说明见 environment_variables.md模型文件格式细节见 MODEL-FORMATS.md。一键安装两步跑起 Bonsai 小模型克隆仓库并进入目录git clone https://gitcode.com/GitHub_Trending/bo/Bonsai-demo cd Bonsai-demo指定模型尺寸然后执行安装脚本自动装依赖、下载模型和预编译二进制无需手动配置任何环境export BONSAI_MODEL8B # 可选值27B / 8B / 4B / 1.7B ./setup.shWindows 用户改用 PowerShell$env:BONSAI_MODEL 8B后运行.\setup.ps1入口脚本为 setup.ps1。setup.sh会依次完成检查系统依赖 → 安装 uv → 创建 Python 虚拟环境 → 从 HuggingFace 下载模型 → 下载预编译 llama.cpp 二进制 → macOS构建 MLX → 安装可选的 Open WebUI。重复执行是安全的已完成的步骤会自动跳过。快速切换 4B / 1.7B 模型尺寸所有启动脚本都遵循同一套环境变量切换尺寸零成本BONSAI_MODEL4B ./setup.sh # 下载并运行 4B BONSAI_MODEL1.7B ./setup.sh # 下载并运行 1.7B BONSAI_FAMILYbonsai BONSAI_MODEL4B ./setup.sh # 1-bit 家族的 4B小技巧BONSAI_MODELall一次下载全部四个尺寸方便对比测试下载逻辑集中在 scripts/download_models.sh。启动本地聊天服务器8B 实战装好后一条命令即可开启带网页聊天界面的本地服务打开http://localhost:8080就能对话BONSAI_MODEL8B ./scripts/start_llama_server.sh也可以单条提问、即时看到回答BONSAI_MODEL4B ./scripts/run_llama.sh -p 给我讲个关于盆栽的冷知识Windows 下对应 scripts/run_llama.ps1 与 scripts/start_llama_server.ps1Apple Silicon 上还可以走 MLX 后端scripts/run_mlx.sh多轮对话体验更顺。8B 的记忆与上下文8B 支持最长 65,536 token 上下文估算占用约为——8K 上下文约 2.5 GB、32K 约 5.9 GB、65K 约 10.5 GB普通家用电脑毫无压力。实测速度8B / 4B / 1.7B 在你的硬件上跑多快社区基准数据community-benchmarks/节选解码速度 TG128token/s硬件后端8B4B1.7BRTX 3080 10 GBCUDA1-bit197256423Intel i3-7100 纯 CPU1-bit3.66.514.3GPU 上 8B 就有近 200 token/s 的响应体验接近实时语音没有显卡也不用慌最老的 i3 纯 CPU 跑 1.7B 仍有 14 token/s完全可用。详细单卡数据可看 cuda-rtx3080-linux.md 和 cpu-i3-7100-linux-proxmox.mdTernary 家族结果在 community-benchmarks/ternary-bonsai/。轻量场景调优6 个实用建议按内存选尺寸16 GB 内存选 8B8 GB 选 4B4 GB 或虚拟机/嵌入式选 1.7B。CPU 慢于预期就关掉 GPU 自动分配BONSAI_NGL0 ./scripts/run_llama.sh ...强制纯 CPU弱集显尤其受益。内存紧张时压上下文BONSAI_CTX8192 ./scripts/start_llama_server.sh上下文默认按机器内存自动分档一般无需干预。Mac 上只留 MLX 省磁盘BONSAI_SKIP_GGUF1 ./setup.sh。想要更高质量保持默认的BONSAI_FAMILYternary2-bit 格式在速度损失很小的情况下质量更高。遇到问题先看 FAQM5 Mac 的 Metal 报错、CUDA 构建 OOM 等坑README.md 附录 FAQ 与 AGENTS.md 都有现成解法。延伸阅读白皮书1-bit-bonsai-8b-whitepaper.pdf · ternary-bonsai-8b-whitepaper.pdf全部环境变量参考environment_variables.md目录结构模型下载后位于models/gguf/8B、models/gguf/4B、models/gguf/1.7B二进制位于bin/详见 README.md 的 Folder Structure 一节。从 1.7B 到 8BBonsai-demo 让本地跑 LLM真正做到了零门槛——选对尺寸、一条命令轻量 AI 助手即刻上线 【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门