十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Bonsai-demo 4070 Ti Super性能解析:Windows CUDA 69.6 t/s实测

Bonsai-demo 4070 Ti Super性能解析:Windows CUDA 69.6 t/s实测 Bonsai-demo 4070 Ti Super性能解析Windows CUDA 69.6 t/s实测【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demoBonsai-demo 让 27B 参数的本地大模型在一块 16 GB 的消费级显卡上流畅运行。本文基于社区提交的 Windows CUDA 实测数据解析 NVIDIA RTX 4070 Ti Super 运行 Ternary-Bonsai-27B 时 69.6 t/s 的生成速度从何而来并给出在你的 Windows 电脑上三步复现的完整步骤。硬件与测试环境一览项目配置GPUNVIDIA RTX 4070 Ti SUPER 16 GBMSI VENTUS 2X OC285WCPUIntel Core i7-14700KF20 核 / 28 线程内存32 GB DDR5-6400 CL32系统Windows 11显卡驱动 32.0.16.1074推理后端llama.cpp CUDA开启 flash-attn-ngl 99全层卸载到 GPU这台机器是社区贡献者手工组装的游戏主机轻度降压、不超频测试全程无热降频——也就是说这套数字在普通原装硬件上可以直接复现。完整原始数据见 cuda-rtx4070tisuper-windows.md。27B 模型实测69.6 t/s 是什么水平关键点在于Ternary-Bonsai-27B约 1.7 bit/权重的三值量化打包进 2-bit 加速内核权重只有6.66 GiB可以完整塞进 16 GB 显存四层模型大小全部全上 GPU模型权重大小pp512 预填充速度tg128 生成速度Ternary-Bonsai-27B6.66 GiB1,717 t/s69.6 t/sTernary-Bonsai-8B2.03 GiB6,675 t/s215.7 t/sTernary-Bonsai-4B1.02 GiB10,894 t/s311.7 t/sTernary-Bonsai-1.7B436 MiB25,484 t/s532.7 t/s两个指标一分钟看懂pp512prefill模型读完512 个 token 提示词的速度决定你发出问题后第一秒的响应快慢tg128token 生成128 token 上下文下的逐词输出速度也就是聊天时你真实感受到的打字速度。69.6 t/s 体感如何1 个 token 约对应 1.5~2 个汉字输出速度约 100 字/秒远超人类阅读速度——回答基本是实时流式涌出的本地使用 27B 大模型体验已接近云 API。为什么这块消费级显卡能冲进前三对比社区提交的 27B 基准榜节选自 community-benchmarks/ternary-bonsai/README.md硬件后端pp512 (t/s)tg128 (t/s)RTX PRO 6000 Blackwell 96 GBCUDA4,552129.9L40S 48 GBCUDA3,03674.34070 Ti SUPER 16 GB本文CUDAWindows1,71769.6RTX A5000 24 GBCUDA1,03648.2Apple M5 Max 48 GBMetal81645.8RTX 5060 Ti 16 GBCUDA1,02944.4两个结论生成速度仅略落后 48 GB 数据中心卡 L40S69.6 vs 74.3 t/s明显领先 A5000、5060 Ti 和大多数 Mac 配置显存才是真瓶颈而 16 GB 恰好够用27B 权重只占 6.66 GiB剩余约 9 GiB 留给 KV 缓存。官方内存表中 100K 上下文的 27B 峰值约 13.7 GiB16 GB 卡刚好装得下——混合注意力架构让 KV 缓存对体积极为友好。速度背后的组合拳三值量化把 27B 压到约 1.7 bit/权重 -ngl 99全层 GPU 卸载 flash-attn 吞吐优化三者叠加让 285W 的 4070 Ti Super 全程满负载不降频。Windows 三步复现从 clone 到聊天界面第 1 步一键安装——setup.ps1自动装依赖、下载 27B 模型与 CUDA 预编译二进制git clone https://gitcode.com/GitHub_Trending/bo/Bonsai-demo cd Bonsai-demo Set-ExecutionPolicy -Scope Process -ExecutionPolicy Bypass .\setup.ps1第 2 步命令行直接问答.\scripts\run_llama.ps1 -p What is the capital of France?第 3 步启动 Web 聊天界面http://localhost:8080支持思考模型与视觉输入.\scripts\start_llama_server.ps1想跑更小的模型更快但更轻在执行安装脚本前设置$env:BONSAI_MODEL 8B即可8B 在这块卡上能跑到 215.7 t/s。全部 24 个环境变量参考 environment_variables.md。进阶调优把 4070 Ti Super 榨得更干推测解码BONSAI_SPECULATIVE1用小 drafter 模型提前猜写 27B 输出官方在 L40S 上测得解码提速 1.8–2.4x代码/数学场景收益最大详见 SPECULATIVE.md4-bit KV 缓存BONSAI_KV41让长上下文显存占用减少约 3.5 倍为上下文腾出更多空间详见 KV-CACHE.md上下文长度控制BONSAI_CTX可固定上下文最高 262,144显存紧张时调小上下文是最快的省显存手段。总结4070 Ti Super 不只是游戏卡在 Bonsai-demo 加持下它能在 Windows CUDA 上实时跑 27B 本地大模型——1,717 t/s 预填充、69.6 t/s 生成体验直逼云 API。如果你的显存是 16 GBBonsai-demo 默认下载的 27B 模型正是为你准备的甜点配置。【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表