我是从淘宝的一个普通店铺购买的NVIDIA DGX Spark (GB10 Grace Blackwell) , 本来选的另外一家31899元, 结果付款前看到另一家便宜了500块, 只要31399,对比了一下淘宝上大批这类卖家, 谁便宜就买谁的了, 反正这东西还比较新, 也造不了假。如果当时能等到618还能再便宜900块。
是否先让AI帮忙列个文章提纲来写???但本着原创的精神, 打算自己一个字一个字的写一篇人类味的分享。
by 技术奇客ITGeeker.net
艰难的大模型选择
买了黄仁勋送给马斯克的小金砖, 首先想到的是跑什么本地大模型呢?
总以为128G统一内存, 总能跑个特别大的模型吧, 至少也要个100G, 现实很快就会让你觉得很骨感, kv cache, context, 并发等等各种吃内存的存在, 还会发现就算是100G左右的开源可本地部署的大模型似乎也不多。
1. 用什么工具来部署本地大模型
- Ollama
- llama.cpp
- vLLM
- SGLang
这是我尝试过的几个比较有名的工具, 其它的当然还有很多。
Ollama使用最简单, 直接去 https://ollama.com/search 选择一个模型, 然后
# 启动大模型
ollama run qwen3.8:27b
# 启动opencode并使用刚才的大模型
ollama launch opencode --model qwen3.8
# 跑个龙虾和骏马
ollama launch openclaw --model qwen3.8
ollama launch hermes --model qwen3.8
非常简单, 但也有很多限制, 官方打包提供的模型也不是那么多.
如果想折腾和尝试其它的更多的各个机构发布的开源模型、量化版模型、或越狱版模型, 那么就绕不开llama.cpp, vLLM这些工具, SGLang据说比较适合企业级部署, 适配多显卡的模式, 技术奇客ITGeeker.net用它部署过Qwen3.8 27B, 可参考这个脚本试试:
Qwen3.8 27B on SGLang for DGX Spark
一看名称就知道专为NVIDIA DGX Spark (GB10 Grace Blackwell) 优化的, 不过跑出来速度也就30 tokens/s左右.
2. 我用过的模型和当前的本地主力大模型
太多了, Ollama速度不快, 但中规中矩, 当前还装着的:
ollama list
qwen3.8:27b
muse-glimmer:30b-bf16-dflash
nemotron-3.5ightning:latest
gemma4:e4b
qwen3:8b
ornith:35b-bf16
llama4:16x17b
deepseek-coder:33b
qwen3-vl:latest
gpt-oss:120b
gemma4:12b
nomic-embed-text:latest
gemma4:31b
nemotron-3-super:120b
qwen3-coder-next:latest
qwen3.6:35b
Ollama的好处是运行完之后会自动释放内存和显存, 可以留更多的空间跑ComfyUi或则其它模型.
如果通过谷歌搜索, 它会告诉你NVIDIA DGX Spark (GB10 Grace Blackwell) 跑量化模型就是带NVFP4的模型最快, 然后推荐用Nvidia官方vLLM Docker来跑最合适, 其实也不然的, 这些量化的组织各不相同, HuggingFace上的模型又太多, 尝试过很多, 也都不理想.
当前主力模型:
by 技术奇客ITGeeker.net
vLLM跑的Qwen_Qwen3.6-35B-A3B-FP8
50-70 tokens/s
# 启动 vLLM 服务
echo "正在启动 vLLM 服务: ${MODEL_NAME}..."
VLLM_USE_DEEP_GEMM=0 \
VLLM_FLASHINFER_MOE_BACKEND=latency \
TORCHINDUCTOR_AUTOTUNE_MAX_ONLY=0 \
VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=0 \
vllm serve "${MODEL_PATH}" \
--tensor-parallel-size 1 \
--served-model-name "${MODEL_NAME}" \
--max-model-len 131072 \
--max-num-seqs 4 \
--kv-cache-dtype fp8 \
--gpu-memory-utilization 0.55 \
--block-size 16 \
--enable-chunked-prefill \
--max-num-batched-tokens 4096 \
--enable-prefix-caching \
--attention-backend flashinfer \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
用的pip install vllm安装的vllm, 也没用nVidia官网优化版的Docker vLLM, 尝试过很多次, 官方优化版本未必跑的就快。
Hermes 接入后运行也比较快速和顺畅。显存占有在50-70G左右, 不像Ollama会自动释放,占比虽然有点高, 除了跑ComfyUI文生图之类的, 还可以Ollama跑个小模型, 所以还是比较适合,至少还没有OOM.
用的Qwen官方HuggingFace的FP8模型:
找其它NVFP4版应该能省下一半显存, 如果用FP16的全精度版, 显存则会占用多一半, 这也就为什么说NVIDIA DGX Spark (GB10 Grace Blackwell) 用不了真正的大模型了,显存永远都不够。 NVFP4据说会损失一些精度, 能力会有所削弱, 官方的FP8版据说几乎没有损失, 这可能也是为什么技术奇客ITGeeker.net把它当做主力本地大模型的原因吧
3. 尝鲜Qwen3.8 27B新模型
Qwen2026年8月刚开放的大模型, 因为只有27B, 尝试了上面提到的所有四种部署方式, 最后发现最快的竟然是Ollama和SGLang, 能达到30token/s.
vLLM部署后尝试了各种参数, 都只有7-9token/s每秒左右, 而且占用显存100G以上,很是奇怪, 只能说不同的模型要用不同的马车拉吧, 稠密模型太占显存?
技术奇客ITGeeker.net会继续测试Qwen3.8 27B, 据说Qwen3.8 35B也会即将到了, 毕竟是隔代升级应该能替换Qwen3.6吧
4. 越狱模型
如果你想尝试一些黑客攻防的代码, 写一些自己偷偷看的露骨小说, 问一下禁言或涉及安全的问题, 那么可以尝试一下越狱模型。
这些模型一般都是gguf格式, 所以llama.cpp是最佳选择, 而且一般提供各种量化版2bit, 4bit等等, 可以在较小的显存环境使用, 也是很多低显存机器的最佳选择了。
什么稠密模型(Dense Models)或则混合专家模型(MoE, Mixture of Experts)之类的,不管怎么说,能让玩家本地部署, 速度又快, 又尽可能不失智的才是好选择, 目前看来Qwen还是不错的选择。
有朋友当时问技术奇客ITGeeker.net自己部署和购买的token大模型对比怎么样, 明确的告诉大家, 那是肯定比不上的,人家那是商用使用集群机房部署的, 一个小主机怎么攀比。
One more thing, 分享一下这一个月使用Minimax M3的token数, 10多个亿而已。不过幸亏是包月的, 比较便宜。

