引用列表

共 133 条 · lcz.me 论坛 133 / 133
Dell R730 + 双 3070 8G + 56核 + 512G DDR4 跑 Qwen3.6-35B-A3B APEX 200K 50 t/s 多模态
— lannykov
Q8在我的coding优化启动脚本下,平均生成为43t/s,体感可用。 显存占用不到32G,4080s 32g魔改卡等显卡可用
— Ivan Yin
24G跑27B勉强, OS占几个G, 系统swap; 35B A3B稍快20-30t/s
— xx8897
M5 32G oMLX Qwen3.6-27B 8bit 96K 上下文十几 t/s
— Vittoria Veloso
一、测试环境 项目 规格 GPU NVIDIA GeForce RTX 2060 SUPER 8G (可用显存 7158 MiB) CPU Intel Core
— williamlouis
基準測試 vLLM cu130 nightly (0.20) -> v0.22.1 cu129, 其餘包括benchmark不變 之後測試如果沒再提及Do
— 566656661
Intel NUC+2080Ti 22G魔改跑Qwen3.6-27B Q4 20 t/s
— Pita
3060 12G跑Qwen3.6 27B 0.8 tokens/s 慢到死
— joker_chang
3070 8G 跑 35B A3B 多模态 25 t/s,CPU 20 线程
— frank lee
3080 跑 Qwen3.6-27B Q4KM 65K 上下文 32 t/s 显存温度 92 度
— Tide
硬件环境:X99 双路 E5-2682v4 / DDR4 2133 / Sapphire Pulse
— abaalei
RTX 4060 8G 跑 Qwen3.6-35B-A3B-APEX-MTP 30+ t/s, 代码 45-50 t/s,CPU MoE 32 线程
— ezios
4060Ti 16G跑Qwen3.8-27B XS-PRO MTP负优化 18.9 vs 12.8 tok/s
— 胜威马
8G笔记本跑35B Q4, 装包+UI+多模态+Thinking, OpenAI兼容API 8090端口
— bingqin wang
RTX 4070 Ti SUPER 16GB Qwen3.8-27B UD-Q3 64K 10+t/s
— Canhui Li
4070Ti Super 16G 跑 Qwen3.6-27B Q4_K_M (16K, 14.5GB) + Qwen3.5-9B Q8_0 (128K)
— Xiaote
@ demo 记得是通过加载mmproj 启用视觉, 但是mmproj 和MTP没办法同时开,后面没用这个模型
— Michael Zhou
llama-server配置: q8_0 KV, MTP draft-n-max 5, ctx 200K, parallel 1, --ctx-checkpoints 32
— marsempire
5060 Ti 16G Qwen3.8-27B UD-IQ4_XS prefill 576 t/s 41 t/s 64K
— gwager
RTX 5060ti 16G + RTX 3060 12G + llama.cpp + rpc 跑 27B 18 t/s
— Abel T.P. Han
技术指标 具体规格 / 性能表现 制程工艺 TSMC(台积电)3nm CPU 架构 20核 Nvidia Grace Arm 核心(MediaTek 联合设计)
— Tiger
5070 Ti 16GB 896GB/s IQ4_XS 38-43 t/s IQ4_KS 51 t/s NVFP4 55-65 t/s
— 王池川
2026-05-26 00:20:55 [DEBUG] LlamaV4::load called with model path: C:\Users\user\
— sky
6800XT 16G 跑 Qwen3.6-27B UD-IQ3_XXS + MTP 128K TG 28-38 t/s PP 200
— coin1860
P4 8G e2b模型18 t/s, 驱动不让p4开wddm
— 陳瑋
ik_llama.cpp TurboQuant V100 16G 跑 27B 100K 上下文 28 t/s;5600Ti 16G 50K 25-27 t/s
— y2k
贴主抱歉了,泡了一下论坛,发现v100 跑大模型还真可能,附上27b模型链接, [https://huggingface.co/sokann/Qwen3.6-27B-GGUF-4.262bpw](https://huggingface.co/sokann/Qwen3.6-27B-GGUF-4.262bpw), 不过它
— y2k
双2060 12G+2070 8G跨卡拼32G跑35B MTP, decode 88.8 t/s, 穷人玩法
— Remy Chiang
双 2080Ti 整机 6500 元 24/7 170W 限制 FP8 KV16 128K
— rock shi
3070Ti 8G 跑 Qwen3.6-27B Q4KM 2.84 t/s;Qwen3.6-35B-A3B-IQ4_XS 35 t/s
— 19-徐福政
双 3080Ti PCIe 3.0 x8/x8 无 NVLink layer-split Qwen3.6-27B-MTP 61 t/s 100K
— zorg
双5060Ti 16G跑Qwen3.8-27B + 文生图/视频 + Hermes+DeepSeek V4 Flash
— frank lee 1
3060x2 TP跑Qwen3.6-27B 20-22t/s; 5060Ti 16G跑ComfyUI H3视频960x640 1小时6分
— Abel T.P. Han
双 5070 Ti llama.cpp Qwen3.8-27B NVFP4 TP+MTP 70 t/s 262K
— 叶镇源
双 5080 16G TP=2 跑 Qwen3.6-27B Q4_K_M,NVLink 缺失对 decode 影响 20-30%
— Xiaote
双6800XT 32G llama.cpp-turboquant-hip跑Ornith-1.5-35B-A3B 51 t/s
— 西域草影
双 V100 32G Q8 GGUF mtp 2 tg128 4K 43-52 t/s 32K 37-46 t/s
— soop ladios
2080Ti 22G MTP 27-33 t/s 128K 显存 20.5G 250W
— davidwei0826
3080 20G魔改跑Gemma4 26B A4B QAT, 短ctx125t/s 100K+掉到61t/s; 双2080Ti跑Qwen3.6-27B-AWQ prefill 1800tok/s
— frank3080
vLLM + 3090 + Qwen3.6-27B-autoround-int4 + MTP=3 触发无限复读
— ai
4080S 32G 魔改 320W Q8 KV MTP3 262K 63.56 t/s
— Takano RR
7900xt 20G + LM Studio + ROCm + q4km 23-24 t/s
— jenaflex
win11 hyper-v + ollama 跑 Qwen3.6:27B 30t/s
— 張耀東
这部分说具体折腾过程。 1. 为什么 D1581 没继续用来带 4090D D1581 不是废物。做 NAS、轻服务、低功耗常驻都可以。 但带 4090D 48G 长期跑本地大模型,我觉得不合适。 不
— Ivan Yin
Intel B70 PRO 32G 跑 Qwen3.6-27B OCR 批量;16-20 并发甜蜜点;26 并发 KV cache thrashing
— sirwang
RX 7900XTX Q5_K_MTP 62 t/s Q4_K_XL 48 t/s RTX 3080 Ti 12G+110G 跑 GPT-OSS-120B 14 t/s
— abaalei
P40 24G Linux下跑Gemma4 26 42 t/s, 写代码简单可复杂不行
— David Zhang
R9700 32G llama.cpp Vulkan Q4_K_M+MTP 代码生成 53 t/s prefill 730 t/s
— PhoenixRise2026
64G够R9700 32G卡推理; LRDIMM比RDIMM热1-3W; 27B Q4 16GB, 35B MoE Q4 20GB
— Xiaote
llama-server启动参数, -c 128000 -fa on, cache-type q8_0
— [[global:former-user]]
16G→24G带宽448→1008GB/s 视频生成质变; 3070笔记本INT8比BF16慢是路径问题; MiniMax H3需要32G+
— Xiaote
vllm0.26+lmcache0.5.3; turboquant_4bit_nc vllm0.26有bug; max-num-seqs 32时700tps
— Che
4090D 48G SGLang Qwen3.8-27B 70K 后频繁 prefill
— 用户名违规
@ Tony Wang 你说得对,我搞错了,面壁。 RTX Pro 5000 确实是 48G(Ada Generation)和 72G(Maxwell 架构?实际是 Blackwell 世代),我的锅
— Xiaote
RTX 5090 32G NInfer Qwen3.8-27B NVFP4 13.7小时 1205 请求 中位 143 t/s
— 跑 13 小時真實編程任務的數據、6 個坑、以及「並發不是越大越快」 — sky
回复: [下单 7900xtx](开始折腾 llama.cpp) 周末简单试了一下. 主要目标达成, 就是能够在 vram 中完整跑 qwen3.6-27b 且
— laobenxiong
ROCm+TurboQuant: pp 970 t/s tg 29 t/s; Vulkan+MTP: pp 730 tg 67 t/s
— David Zhang
@ 909 AMD的卡在Ubuntu上跑是完全可行的,我来说说实际情况: 现行支持度:ROCm 6.
— Xiaote
32G卡双服务各25G, 官方+去拒答版同时跑200K; 必须--jinja覆盖官方空think块
— 清风明月
RTX Pro 4500 上 PrismaQuant NVFP4 量化测试,vLLM 0.24
— 566656661
2 x RX7900XTX, EPYC 7313P, Windows 11, LM STUDIO, 跑Qwen3.6 27B q6_k_XL 只能达到 33t/
— World Peace
以下大部分是比较罗嗦的流水账,技术内容在分割线后。 前阵子入坑了本地AI。手上有两张3090,但是自己用的机器机箱、电源只够跑一张。而且平时要打打游戏,用Adobe系列软件,需要占用显卡,来回释放显存
— 2x3090 + X99 + 2x2680v4 — Ray Wang
4x5060ti TP=4 跑 Qwen 3.6 27B Q4_K_M
— Xiaote
4 卡 7900XTX vLLM Qwen 27B W4A16 短上下文 1388-1450 t/s INT8 prefill 1209 t/s
— iamvirus
13600KF + 3090+3080 20G+3080 10G 跑 Qwen 3.6 27B Q6_K + Hermes 128K, 17-18 t/s
— Gavin2024
3卡(4090 48G + R9700 32G + 8060S 128G) llama.cpp -ts跑MiniMax2.7 230B 102GB 27.74t/s, Qwen3.5-122B Q4 53.63t/s(双卡4090+R9700), Qwen3.6-27B Q4 R9700 26.56t/s, 27B A
— Fred
2080Ti 22G x2 NVLink 跑 Qwen3.6-27B 20 t/s,35B-A3B 64K+;3090 跑 27B + ComfyUI
— tutu
llama.cpp b10621 CUDA13.3 Qwen3.8-27B Q8_0 3卡 layer 切分 5 并发
— alex wang 0
双卡 2080 Ti 22G NVLink P2P 40GB/s all_reduce 72.6 GB/s 跑 Qwen3.8-27B-FP8 128K
— rock shi
AWQ+MTP接受率0.05 accept len 1.15, MTP头被量化搞坏; topk=1太激进; 换FP8+MTP或twolven/abliterated-AWQ-MTP
— Che
双 3090 NVLink vs No-NVLink: decode -3.5%, prefill -26%
— applejuice
XTX跑35B Q4+120K已撞24G显存墙; 35B Q4 20G权重+4G KV; 二手3090 5-6K
— Xiaote
双A10 48G+128GB 跑Qwen3.8-Flash-Next 103.69GB prefill 361 t/s gen 13.9 t/s 130K ctx 4.45 t/s
— Bunsei
双 Intel B70 32G TP=2 vLLM Qwen3.8-27B FP8 64K Docker
— sirwang
B70 Pro ComfyUI docker 封闭问题;wan/ltx2.3 OK;cuda custom node 不可用
— sirwang
TP+MTP 总等待缩短 32-34% PP+DFlash2 vs PP+MTP 3-5%
— Bunsei
3060x2跨卡tensor split跑27B Q4 15-20t/s; R9700 RDNA4要ROCm 6.3+; ComfyUI主流节点能跑
— Xiaote
Z390刷BIOS支持x8/x8, 破解P2P, 220K F16双卡余3-4G; nvlink 1000元换20% prefill
— stxpnet
华南金牌 X99 + 3090Ti + 3060 + 长城 1250W;PCIe 槽位/Boot 模式调整后正常
— joker_chang
27B Q8 29G+32K Q8 KV(5G)需双3090 48G; 双4080S只有32G塞不下; 主板X670E要x8/x8
— Xiaote
Qwen3.8 27B FP8 SGLang 24 tok/s 双4090D 48G多会话
— terry
双RTX 5090 32GB+9950X3D+60GB+Ubuntu24.04 跑Qwen3.8-27B-BF16 140K prefill 1158 t/s decode 48 t/s
— David Chen
9900X核显+93.7G内存跑Qwen3.6-27B Q4_K_M 2-5t/s; 推荐双3090 24G 替代魔改
— Xiaote
双 7900 XTX vLLM W4A16 Qwen3.8-27B TP=2 256K 短上下文 TP+dflash2 155-170 t/s
— flyer666
2 张 V100 32G 跑 Qwen3.6-27B Q8 ~30 t/s, Ornith-1.0-35B Q8 ~100 t/s
— soop ladios
GA100阉割4480核, PCIe 4.0 x4, 250W; 微调生态坑大, 不建议
— Xiaote
170HX 64G跑Qwen3.8 27B w8a16 262K SGLang DFlash 32K内100t/s 200K 60t/s 多并发300t/s; Flash Q4 256K llama.cpp 20t/s
— cool zero
魔改4090D 48G 24小时崩溃5次+空载花屏, 显存颗粒不稳
— Bukong Li
5090 2.5W vs Pro 5000 48G 比 5090 贵 1W+;批量做 10s 视频;XTX comfyui 太慢
— Ex_Super
Pro 5000 48G散热86C 风扇65% 噪音大; Q4 4K输入59.14t/s; MiniMax让我想尝试视频
— Tony Wang
@ 32ethers 感谢分享踩坑经验!关于你遇到的问题,我研究了一下: "on-device sampling unsupported on this backend" 这条报错确实是关键。llam
— Xiaote
L20单卡,我用SGLANG部署的qwen3.6-27B(FP8),MTP设置为3,速度大概45,开130K上下文,但只能2个 并发
— 易先生
不过L40S跑27B这个速度其实不太正常,有几个地方你可以看看: 260K上下文是主要原因 — 27B模型在260K ctx下,KV cache会吃掉大量显存带
— 准备放弃了 — Xiaote
M1 Max 64G omlx Qwen3.5-35b-a3b-4bit-mlx 30 几 t/s
— 怪叔叔
M3 Max 128G 8T 跑 Ollama Qwen3.5-27B 慢;考虑卖 Mac 换 3080 20G/7900XTX
— Phuong Ngo
不是不能用,是你會需要小心分配:VM 100 給 36GB,VM 103 給 36GB,gateway 再拿一些,host 自己也要留
— CS6
Mac M4 Pro 64G用ds4 SSD streaming跑DeepSeek-V4-Flash-Vision 10 t/s
— James Chen
M5 Pro 64G 35A3 80-90 t/s,64K 几轮后内存 50G
— Tony Wang
3080 40G 魔改 llama.cpp MTP 35-60 t/s 27B 128K 富裕
— rock shi
他们这个需求其实要满足的话不算难,直接上RTX 6000 PRO一张就可以,他们也没有严格的精确度要求,都不用跑FP8模型,跑Q4_K_M就行,然后AI服务器上
— 九龙杨生
RTX PRO 5000 48G 跑 Qwen3.8-27B-FP8 226K ctx decode 60.5 t/s prefill 5089 t/s
— kop wang
RTX PRO 6000 96G 跑Qwen3.8-27B-NVFP4 + DFlash2
— Arroyo Cheung
W7900 48G Qwen3.6-27B Q4 MTP 20→50 t/s 带 mmproj 视觉
— Kiner Liu
林业咨询 绝对花得起部署 h100 8卡 AI 服务器,推荐; Qwen3.
— imbiplaza ASUS
到最后写文档时,可以达到125t/s. 这个卡差在bf16算力只有rtx 6000 ada的一半
— fly86
4×3060 12G + 3×3080 10G + 3090 24G 矿渣变 AI 工具
— patrickh0h0
4×B70 Pro vLLM Qwen3-8B 57 t/s <300W;4 卡 400-600W
— sirwang
GPU: 4× NVIDIA L20 (48GB each, Ada Lovelace, sm_89) CPU: 4× L20 = 192GB 总显存 (用了
— Foster Xu
4xR9700 128G 技嘉G292-Z20+AMD 7K62 跑Qwen3.8-27B-FP8 vllm TP=4 180K ctx hermes多用户prefill慢
— gk20082000
Pro5000 48G/72G比双4090省心; 4090 48G魔改真实价值1万, 现在3万
— terry
2 台 DGX SPARK GB10 跑 DeepSeek-V4-Flash-DSpark (FP4+FP8), 实际 45-65 t/s, 6 个 500K 任务并发
— soop ladios
两台GB10 200G互联(100G rail+100G), 两台速度1.5x单台, 6个500K ctx session, iperf 97G
— soop ladios
双GB10 (Asus Ascent GX10) 跑DSV4-Flash-0731 FP8+NVFP4, PP 1500-2500, decode 35-76 t/s, 双机两台各跑一个session
— benton yi
@Bukong Li 欢迎!
— Xiaote
Q3.8-27B BF16 54GB权重; 1张MI210够, 2张浪费; 桥接器不可用
— Xiaote
MI210 64G HBM2e 1.6TB/s ~A100 80G; 无Windows无FP8; gfx90a; 70B Q4/32B Q8全进显存
— Xiaote
单台DGX Spark跑Qwen3.8-Flash-Next NVFP4 PP 1500-2000, decode 30 t/s, KV 630K, 跑一周稳定
— soop ladios
Mac Studio M3 Ultra 512G 跑 DeepSeek V4 flash Q2 30 t/s 同时跑 27B
— Devin Hi
最近网上看了很多 M5 MAX 跑模型的评测和视频, 虽然可以有很大的统一内存来装模型, 但是模型大了之后, 性能下降很多, 基本是 5-10个t/s , 没法
— johnnybegood
64GB M5 Pro推荐; 同款在M4 Pro可到60-100+ t/s
— Xiaote
M5 Max 128G + oMLX + Hermes 测 3 款模型: 35B-A3B PP 963/TG 50.8, 27B PP 254/TG 17, V4 Flash 2bit 差
— Gary Pan
M5 Ultra 96G 跑 Qwen3.8-27B 70 t/s,256G 跑 300B Q4 体验不错
— terry
@ johnnybegood M5 Max 跑 Qwen 122b a10b Q4 的话, 如果内存够, 不大可能只有 20-25t/s. 我的M5 pro 跑
— Tony Wang
@ terry 个人认为与其称之为“性能过剩”的说法,不如还是“和需求不匹配”来的恰当。在这里想较个真哈,纯粹是阐述一下剖析底层需求的逻辑方法,如果能帮到硬件选型的朋友也算歪打正着了: 1,假如像之前
— benton yi
10 台 DGX SPARK GB10 其中 8 台跑 GLM 5.2 ctx 320K x 10
— soop ladios
8 卡 A100 跑 GLM 5.2,内存不足,上下文窗口只剩 100k
— Alexander Lee
8 台 DGX SPARK 跑 GLM 5.2 DCP4, ctx 300K x 10
— soop ladios
6xRTX 8000 48G 288G总显存, 2x Qwen3.8-27B Q8 27ms/token (32-36 t/s 2并发), 2x Qwen3.6-35B-A3B 202 t/s, 2x Ornith-1.0-35B 181 t/s, 公网new-api
— 木生火
4x DGX Spark 跑 GLM 5.2 Quantrio INT4+INT8 混合 + DFlash, 4 并发 95.7 t/s
— fcme
4 Pro6000 LLM 训练+推理+H3 视频 PCIe 5.0 4U 长期重载
— Jake Kwoh
我办公室4张PRO6000都不够3个人使用
— CS6
3 张 3090 但只想用 2 张 普板需 NVLink 桥接
— Thanaots
双 B200 vLLM Qwen3.8-27B-FP8 DFlash2 num_speculative_tokens=7
— Misakiyu Xmilk
没有匹配项