我是从淘宝的一个普通店铺购买的NVIDIA DGX Spark (GB10 Grace Blackwell) , 本来选的另外一家31899元, 结果付款前看到另一家便宜了500块, 只要31399,对比了一下淘宝上大批这类卖家, 谁便宜就买谁的了, 反正这东西还比较新, 也造不了假。如果当时能等到618还能再便宜900块。

是否先让AI帮忙列个文章提纲来写???但本着原创的精神, 打算自己一个字一个字的写一篇人类味的分享。
by 技术奇客ITGeeker.net
艰难的大模型选择
买了黄仁勋送给马斯克的小金砖, 首先想到的是跑什么本地大模型呢?
总以为128G统一内存, 总能跑个特别大的模型吧, 至少也要个100G, 现实很快就会让你觉得很骨感, kv cache, context, 并发等等各种吃内存的存在, 还会发现就算是100G左右的开源可本地部署的大模型似乎也不多。
1. 用什么工具来部署本地大模型
- Ollama
- llama.cpp
- vLLM
- SGLang
这是我尝试过的几个比较有名的工具, 其它的当然还有很多。
Ollama使用最简单, 直接去 https://ollama.com/search 选择一个模型, 然后
# 启动大模型
ollama run qwen3.8:27b
# 启动opencode并使用刚才的大模型
ollama launch opencode --model qwen3.8
# 跑个龙虾和骏马
ollama launch openclaw --model qwen3.8
ollama launch hermes --model qwen3.8
非常简单, 但也有很多限制, 官方打包提供的模型也不是那么多.
如果想折腾和尝试其它的更多的各个机构发布的开源模型、量化版模型、或越狱版模型, 那么就绕不开llama.cpp, vLLM这些工具, SGLang据说比较适合企业级部署, 适配多显卡的模式, 技术奇客ITGeeker.net用它部署过Qwen3.8 27B, 可参考这个脚本试试:
Qwen3.8 27B on SGLang for DGX Spark
一看名称就知道专为NVIDIA DGX Spark (GB10 Grace Blackwell) 优化的, 不过跑出来速度也就30 tokens/s左右.
2. 我用过的模型和当前的本地主力大模型
太多了, Ollama速度不快, 但中规中矩, 当前还装着的:
ollama list
qwen3.8:27b
muse-glimmer:30b-bf16-dflash
nemotron-3.5ightning:latest
gemma4:e4b
qwen3:8b
ornith:35b-bf16
llama4:16x17b
deepseek-coder:33b
qwen3-vl:latest
gpt-oss:120b
gemma4:12b
nomic-embed-text:latest
gemma4:31b
nemotron-3-super:120b
qwen3-coder-next:latest
qwen3.6:35b
Ollama的好处是运行完之后会自动释放内存和显存, 可以留更多的空间跑ComfyUi或则其它模型.
如果通过谷歌搜索, 它会告诉你NVIDIA DGX Spark (GB10 Grace Blackwell) 跑量化模型就是带NVFP4的模型最快, 然后推荐用Nvidia官方vLLM Docker来跑最合适, 其实也不然的, 这些量化的组织各不相同, HuggingFace上的模型又太多, 尝试过很多, 也都不理想.
当前主力模型:
by 技术奇客ITGeeker.net
vLLM跑的Qwen_Qwen3.6-35B-A3B-FP8
50-70 tokens/s
# 启动 vLLM 服务
echo "正在启动 vLLM 服务: ${MODEL_NAME}..."
VLLM_USE_DEEP_GEMM=0 \
VLLM_FLASHINFER_MOE_BACKEND=latency \
TORCHINDUCTOR_AUTOTUNE_MAX_ONLY=0 \
VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=0 \
vllm serve "${MODEL_PATH}" \
--tensor-parallel-size 1 \
--served-model-name "${MODEL_NAME}" \
--max-model-len 131072 \
--max-num-seqs 4 \
--kv-cache-dtype fp8 \
--gpu-memory-utilization 0.55 \
--block-size 16 \
--enable-chunked-prefill \
--max-num-batched-tokens 4096 \
--enable-prefix-caching \
--attention-backend flashinfer \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
用的pip install vllm安装的vllm, 也没用nVidia官网优化版的Docker vLLM, 尝试过很多次, 官方优化版本未必跑的就快。
Hermes 接入后运行也比较快速和顺畅。显存占有在50-70G左右, 不像Ollama会自动释放,占比虽然有点高, 除了跑ComfyUI文生图之类的, 还可以Ollama跑个小模型, 所以还是比较适合,至少还没有OOM.
用的Qwen官方HuggingFace的FP8模型:
找其它NVFP4版应该能省下一半显存, 如果用FP16的全精度版, 显存则会占用多一半, 这也就为什么说NVIDIA DGX Spark (GB10 Grace Blackwell) 用不了真正的大模型了,显存永远都不够。 NVFP4据说会损失一些精度, 能力会有所削弱, 官方的FP8版据说几乎没有损失, 这可能也是为什么技术奇客ITGeeker.net把它当做主力本地大模型的原因吧

3. 尝鲜Qwen3.8 27B新模型
Qwen2026年8月刚开放的大模型, 因为只有27B, 尝试了上面提到的所有四种部署方式, 最后发现最快的竟然是Ollama和SGLang, 能达到30token/s.
vLLM部署后尝试了各种参数, 都只有7-9token/s每秒左右, 而且占用显存100G以上,很是奇怪, 只能说不同的模型要用不同的马车拉吧, 稠密模型太占显存?
技术奇客ITGeeker.net会继续测试Qwen3.8 27B, 据说Qwen3.8 35B也会即将到了, 毕竟是隔代升级应该能替换Qwen3.6吧
4. 越狱模型
如果你想尝试一些黑客攻防的代码, 写一些自己偷偷看的露骨小说, 问一下禁言或涉及安全的问题, 那么可以尝试一下越狱模型。
这些模型一般都是gguf格式, 所以llama.cpp是最佳选择, 而且一般提供各种量化版2bit, 4bit等等, 可以在较小的显存环境使用, 也是很多低显存机器的最佳选择了。
什么稠密模型(Dense Models)或则混合专家模型(MoE, Mixture of Experts)之类的,不管怎么说,能让玩家本地部署, 速度又快, 又尽可能不失智的才是好选择, 目前看来Qwen还是不错的选择。
有朋友当时问技术奇客ITGeeker.net自己部署和购买的token大模型对比怎么样, 明确的告诉大家, 那是肯定比不上的,人家那是商用使用集群机房部署的, 一个小主机怎么攀比。
One more thing, 分享一下这一个月使用Minimax M3的token数, 10多个亿而已。不过幸亏是包月的, 比较便宜。












发表回复