
Bonsai-demo AGENTS.md深度解读为AI Agent写的完整硬件调优指南【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demoBonsai-demo 是一个让 Bonsai1-bit与 Ternary-Bonsai 大模型在 Mac、Linux、Windows 上本地运行的演示项目而仓库根目录的 AGENTS.md 则是为 AI Agent当然也适合人类编写的硬件调优指南它告诉你如何根据用户的硬件和场景选对模型、选对参数并附上了真实测试得到的行为结论。对新手来说这是理解本地大模型到底有哪些可调旋钮的最佳入口。先认识 AGENTS.md一份写给 AI Agent 的调优手册AGENTS.md 的定位很明确——当 AI 编码助手帮你部署这个项目时把它的注意力指向这份文档即可。它包含四部分核心内容该展示什么27B 新一代模型的五大能力亮点关键旋钮表每个环境变量/命令行参数的作用与取舍行为备注Apple Silicon 实测经验避免背锅快速验证命令确认服务器状态的两条命令想快速跑起来两条命令即可完整说明见 README.mdgit clone https://gitcode.com/GitHub_Trending/bo/Bonsai-demo cd Bonsai-demo ./setup.sh ./scripts/start_llama_server.sh27B 新模型值得调优的能力跃迁AGENTS.md 开篇就点明了 27B 相对 8B/4B/1.7B 的代际提升这也是调优的目标能力说明️ 视觉端到端图像输入照片、截图通过 mmproj 视觉投影器 工具调用原生 OpenAI 风格tool_calls完整往返已验证 思考推理模型思维过程独立流式输出可按对话设定预算 长上下文48 GB 的 Mac 上支持 256k token 对话 极小体积1-bit 版压缩到约 1.125 bit/权重现代 iPhone 可直接运行模型分两个家族AGENTS.md 模型表ternary27B 默认质量更高和bonsai1-bit最小最快用BONSAI_FAMILY/BONSAI_MODEL环境变量切换全部变量一览见 environment_variables.md。五个最值得记住的调优旋钮以下旋钮均可通过启动脚本直接透传例如./scripts/start_llama_server.sh --image-max-tokens 1024。1️⃣ 一行开启投机解码CUDA 加速 1.8-2.4 倍BONSAI_SPECULATIVE1 ./scripts/start_llama_server.sh加载配套 DSpark 草稿模型做投机解码在 L40S 上实测三元 27B 解码提速 1.8-2.4 倍。⚠️ 注意取舍它在 Apple Silicon 上仅对代码/数学任务有约 1.2 倍收益日常聊天反而变慢因此 Mac 用户不建议开启且会禁用跨请求的提示词缓存只适合单用户场景。详见 SPECULATIVE.md。2️⃣ 4-bit KV 缓存内存工具而非速度工具BONSAI_KV41 ./scripts/start_llama_server.shKV 缓存内存缩小约3.5 倍——10 万 token 上下文只需约 1.8 GiB 而非 6.3 GiB。它让长上下文在内存紧张的设备上成为可能代价是解码略慢。配合 scripts/make_kv_bias.sh 生成校准偏差还能恢复量化损失的质量。详细原理见 KV-CACHE.md。3️⃣ 思考预算慢的元凶往往是想太多--reasoning-budget N将思考上限压到 N 个 token默认不限。AGENTS.md 的实测经验开启思考后慢回答的大头是推理 token 而非视觉或预填充——先怀疑思考预算再怀疑硬件。在网页 UI 中消息框的 Reasoning effort 选择器Off/512/2048/8192/无限按对话实现同样的效果。4️⃣ 图像输入速度与细节的取舍BONSAI_IMAGE_MAX_TOKENS控制图像缩放到的视觉 token 数1 token ≈ 32×32 像素。脚本默认在 Metal / Vulkan / CPU 上限制为1024快但大图细节丢失CUDA/ROCm 上不封顶。做 OCR、读截图小字时设为0换取完整细节。完整视觉说明见 VISION.md。5️⃣BONSAI_NGLN手动控制 GPU 卸载自动检测依据的是安装了什么驱动而非 GPU 性能——集成显卡机器可能被迫卸载到弱 iGPU。若解码速度不及预期尝试BONSAI_NGL0强制纯 CPU反之强 iGPU如 Strix Halo确实受益于卸载。上下文大小则由BONSAI_CTX按内存自动分档超大上下文记得搭配旋钮 2。实测避坑Apple Silicon 行为备注AGENTS.md 最有价值的部分是实测出来的行为备注直接帮你少走弯路⚡二元1-bit版更快三元版质量更高两者均已端到端验证 速度异常低时先检查 macOS 低电量模式——它会显著压制推理性能 MLX 后端没有跨请求提示词缓存多轮对话每轮全量重跑多轮用户建议改用 llama.cpp 后端️ M5 Mac 在 macOS 26.2–26.4 上遇 Metal 初始化报错时设置GGML_METAL_TENSOR_DISABLE1README FAQ 有详述用真实数据说话社区基准调优之后性能如何community-benchmarks/ 收录了社区提交的多硬件实测数据例如 27B 三元模型RTX PRO 6000 Blackwell 解码 129.9 t/sL40S 上配合 DSpark 可达约 150 t/s2.06 倍M5 Max Metal 后端 45.8 t/s。每个条目都是独立文件如 cuda-l40s-linux.md可按硬件对照也欢迎按模板提交自己的数据。快速验证两条命令确认状态# 查看服务器能力与生效的上下文/并发槽位 curl -s http://localhost:8080/props | python3 -m json.tool | head -30 # 每次请求的响应中都带 timings 对象prompt_ms 是编码预填充耗时 # predicted_per_second 是生成速度AGENTS.md 的核心原则正体现于此所有性能结论都来自真实测量在向用户承诺性能之前先在自己的硬件上量一遍。延伸阅读文档内容SPECULATIVE.md投机解码DSpark 草稿模型完整指南KV-CACHE.md4-bit KV 缓存与校准偏差TOOLS.mdMCP 服务器接入指南environment_variables.md全部环境变量参考MODEL-FORMATS.md模型格式与上游状态OPENWEBUI.mdOpen WebUI 演示说明bonsai-27b-whitepaper.pdfBonsai 27B 技术白皮书一句话总结AGENTS.md 把该展示什么、该调什么、坑在哪浓缩成了一份可直接执行的硬件调优清单——无论你是让 AI Agent 代劳部署还是自己动手这份指南都能帮你少踩坑、跑得快。【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考