yiranw09
V2EX  ›  Local LLM

请教一下,本地部署 deepseekV4flash 大概需要什么样的配置需求?

  •  
  •   yiranw09 · 1 day ago · 8794 views
    先说明背景,我们公司是半导体公司,我是生产的工程师,并不是信息部门的,但是生产这边有需求,做自己的数据分析跟踪平台,信息部那边又没人力,我们一个实验管理平台拖了半年了还没给我们做好,我拿 llm 自己都 vibe 了一个。
    现在有两个需求都需要用到 ai ,而且因为数据敏感,还必须是纯本地运行。
    一方面试生产工程师开发自己的数据平台需要 ai 做 vibecoding ,另一方面我们希望能用 ai 做数据分析和建模,这方面我们已经悄悄地通过 ai 输出验证了很多东西了
    之前是国产开源的模型能力一般,能力好的模型又太大,部署成本太高,但是近期 deepseekV4flash 的模型量较小,部署成本大幅度降低,能力也完全胜任我们的需求,前段时间的 dflash 技术也让速度能够显著上升。
    想问问有没有本地部署 deepseekV4flash 的方案,我可以借鉴一下
    然后下周拉着我们生产领导去找信息部领导 Battle
    94 replies    2026-08-07 13:47:25 +08:00
    duanxianze
        1
    duanxianze  
       1 day ago   ❤️ 1
    你为啥不直接问问 deepseek 呢
    duanxianze
        2
    duanxianze  
       1 day ago
    不过我可以提前提醒你一句,目前有钱你都不一定能搞定,到处都在缺货
    OutOfMemery
        3
    OutOfMemery  
       1 day ago
    有专门做内网部署的商家,包括硬件,某宝,视频平台可以找找了解一下
    Kinnice
        4
    Kinnice  
       1 day ago
    Mac Studio
    - M3 Ultra
    - 256GB 统一内存 推荐 512GB
    - 2TB SSD
    106npo
        5
    106npo  
       1 day ago   ❤️ 4
    yiranw09
        6
    yiranw09  
    OP
       1 day ago
    @duanxianze #1 问了啊,它给了好几个配置,有 mac studio 128/256 ,有 H100/A100*2 ,有 ada6000*4 ,但是我也不清楚具体效果如何,想问问实际方案和效果,有没有更适合生产的解
    yiranw09
        7
    yiranw09  
    OP
       1 day ago
    @duanxianze #2 我也在想这个问题...
    yiranw09
        8
    yiranw09  
    OP
       1 day ago
    @OutOfMemery 这要是还找商家我们信息部是真的不用干了 全外包得了
    vandort
        9
    vandort  
       1 day ago   ❤️ 5
    自己运行一个 DeepSeek V4 Flash 级别的大模型大概需要 200G 左右的显存,最便宜的方案是 4 个 48G 的 4090 。我不是很确定 4090 跑 DeepSeek V4 Flash 会不会有数据格式上的问题,但如果有问题的话可以选择 DeepSeek V4 Flash W4A*的版本,精度损失比较小,基本是可用的。问题是 48G 的 4090 目前市场上比较少,不一定能找到。如果没货,替代方案是一台 8 卡 5090 的机器。这两种方案都要花大概 30-50 万。还可以买二手的 910B4 ,应该不会超过 70 万。这些是 5 月底的价格,不知道最近涨价没有。我们的业务里包括了给客户提供各种形式的正规的大模型服务的,有需要可以找我们。
    uiosun
        10
    uiosun  
       1 day ago
    @vandort 涨了的,六月底咨询工作站,两家还不错的公司,问销售都说涨价了
    yiranw09
        11
    yiranw09  
    OP
       1 day ago
    @Kinnice 嘿,现在 Mac studio 涨价也太厉害了,而且 token 输出还是感觉有些慢,加上 mac 不支持 vllm ,而 deepseekv4flash 似乎还没有 MLX 模型吧
    yiranw09
        12
    yiranw09  
    OP
       1 day ago
    @106npo 打不开欸,不知道为什么
    106npo
        13
    106npo  
       1 day ago
    @yiranw09 应该不用翻墙.不过这样的网站挺多的 ,找个支持计算预期 tps 和 ttft 的网站看吧
    evil0harry
        14
    evil0harry  
       1 day ago
    我看有人推荐两台 NVIDIA DGX ,单台 35k 左右
    mzsongyan
        15
    mzsongyan  
       1 day ago
    看看 dgx spark
    levn
        16
    levn  
       1 day ago
    PRO 6000 x 2
    AAAAAAAAAAAAAAAA
        17
    AAAAAAAAAAAAAAAA  
       1 day ago
    个人用和公司很多人用是不一样的,吐字速度跟不上,找个专业的评估一下吧。
    yiranw09
        18
    yiranw09  
    OP
       1 day ago
    @AAAAAAAAAAAAAAAA 所以不是来 V 站问问现成的方案嘛,先有个大概我好去 battle (
    Chihaya0824
        19
    Chihaya0824  
       1 day ago   ❤️ 2
    别买 mac, PP 拉完了,同理由不推荐 dgx spark/AI max 395 ,除非是愿意等那其实 ok ( 395 问题更大,fp8 都不支持)
    正经用就是最低 2 个 pro 6000 或者 4 个多人大 context
    如果电够多也可以选择 8 个 5090 的方案也行

    @vandort 靠谱,sm80 系列其实就是会有不支持 fp4 的问题,就是没办法跑原版(
    yiranw09
        20
    yiranw09  
    OP
       1 day ago
    @evil0harry 似乎可以欸
    yiranw09
        21
    yiranw09  
    OP
       1 day ago
    @Chihaya0824 带宽还是太低了是吗?哎,不知道能不能买得到
    Chihaya0824
        22
    Chihaya0824  
       1 day ago
    还有别买 pro 6000D ,一买一个不吱声
    Hilalum
        23
    Hilalum  
       1 day ago
    https://omlx.ai/compare 这输入模型和芯片可以查到真实部署的 tok/s
    Chihaya0824
        24
    Chihaya0824  
       1 day ago
    @yiranw09 不是,Mac 带宽可以的,我说的是 prompt processing 慢,就是你给他大量长文本的时候你要等很久才会开始吐字,以及并发使用的时候会很慢
    yiranw09
        25
    yiranw09  
    OP
       1 day ago
    @Chihaya0824 #24 嗷我好像知道咋回事,M3 那会还没有加速单元,M5 才加上的
    Vveeb
        26
    Vveeb  
       1 day ago
    > 而且因为数据敏感,还必须是纯本地运行
    我说个题外话, 大清都亡了, 现在中小公司真的有那种很敏感的数据么?
    人家顶尖的 Cyber 模型都已经能发现茫茫多的网络安全漏洞了 (至少人家模型厂商是这么吹的).
    真让人家模型厂商拿到公司的数据了, 这数据对模型厂商有价值么?
    Chihaya0824
        27
    Chihaya0824  
       1 day ago
    @yiranw09 是,没有 matmul 加速导致的,但是 m5 也并没有解决什么问题,目前只支持 fp16/bf16/int8 的加速,不恰当的例子你可以理解为他停留在 sm80(A100)时代
    AEDaydreamer
        28
    AEDaydreamer  
       1 day ago
    @Vveeb 道理懂技术的人都懂, 更多是制度和合规吧.
    foryou2023
        29
    foryou2023  
       1 day ago
    你搜索一下 b 站,我刷到过别人的部署个人使用,个人使用的话,好像 10 万就够了,每秒 Token 在 100 左右好像,不过这个金额记得不是很清楚。
    yiranw09
        30
    yiranw09  
    OP
       1 day ago
    @vandort 看了一下,感觉现在这个价格要更贵了...
    yiranw09
        31
    yiranw09  
    OP
       1 day ago
    @Vveeb 哎...问题是我们的数据不是那种 ai 会需要的数据,而是在生产行业中很敏感的数据,虽然 ai 不需要,但是会有数据泄露,这个很严重。
    wwhc
        32
    wwhc  
       1 day ago
    两块 RTX PRO 6000 ,配置 llama.cpp 用于提供推理服务,满血 v4 flash 也就 160GB 左右。就算是单 RTX 5090 ,也够个人用,输出也可以达到 10-20t/s
    jimrok
        33
    jimrok  
       1 day ago
    建议你用生产的样本数据给 ai ,写出分析程序之后,去跑生产数据。这样敏感信息的处理还是自己控制,但分析工具让 ai 给你造。
    GeTLeFt
        34
    GeTLeFt  
       1 day ago
    @Vveeb 很多啊,比如金融法律这种涉及用户隐私的
    yiranw09
        35
    yiranw09  
    OP
       1 day ago
    @jimrok 问题在于样本数据我都很难发给 ai ,以及生产的数据很复杂,变量影响因素特别多,不给真实数据分析程序是写不明白的,除非我提示词工程能写的特别清晰...但是这个实在是太难了,我们之前偷摸摸用的时候就是这样做的,工程量巨大不说,调试测试也很麻烦,甚至数据还清洗不干净,可是几十万条数据你让我手动清理...哎
    suke119
        36
    suke119  
       1 day ago
    @yiranw09 要么 A100 H100 4 张起步 要么昇腾国产系列 8 张起步 优化完速度 30-40 左右 效果还可以 目前我们实践过的 vllm
    lrabbit
        37
    lrabbit  
       1 day ago   ❤️ 4
    我前天刚部署了一个,两台 dgx spark,昨天连续跑了一个 7w 多行的 rust 代码,跑了十几亿 token ,总体感觉速度比官方 api 慢 30%,本地大概 50token/s,官方 70-100 token/s 目前 dgx spark 是我觉得最适合部署 deepseek v4 flash 的设备,放在桌面上简直是个艺术品,一点声音也没有,等我多跑几天,后续发个测评
    KOMA1NIUJUNSHENG
        38
    KOMA1NIUJUNSHENG  
       1 day ago
    @yiranw09 #8 你可以跟老板报告你拿着 AI 能把信息部的活全揽了,让他把信息部全开了给你涨工资,过两年直接财富自由
    jimrok
        39
    jimrok  
       1 day ago
    @yiranw09 确实,你这样的需求非常多,dgx spark 这样的产品未来会是一个主要的形态。苹果,国内的瑞芯微应该都会类似的产品出来。每个办公室都需要一个这样的数字员工,看看打印机的规模,这个市场真是太大了。
    sparkssssssss
        40
    sparkssssssss  
       1 day ago
    实测,我们有一台 m3 256G/1T 的版本,ds 刚出圈的时候,买来想着内部跑着试试的,结果,实测,跑个 70b 都勉强,能跑,但是速度很慢,正常用,30b 左右的模型,使用问题不大,但是并发也不行
    我以为用的框架有问题,ollma/vllm/lmstudi 都测试了下,来去不大,不推荐 mac ,能跑,但是仅仅是能跑,
    sky009
        41
    sky009  
       1 day ago
    @lrabbit 大佬部署的哪个模型?我看有专门的 DeepSeek-V4-Flash-DSpark 的模型,是否部署的这个版本。
    qishua
        42
    qishua  
       1 day ago
    @vandort 哪来的 48G 型号的 4090 ?,我们之前部署用的是 8 卡的 4090 24G 的,部署的是 ds r1
    kakakakaka8889
        43
    kakakakaka8889  
       1 day ago
    现在昇腾的卡都不好买到
    Jesens
        44
    Jesens  
       1 day ago
    一般来讲 vllm 官网的应该是最准确的: https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4-Flash
    TomatoCLI
        45
    TomatoCLI  
       1 day ago
    当生产力的话你就 36 楼说的,当玩具的话你就按上面说的 Mac 部署。
    hafuhafu
        46
    hafuhafu  
       1 day ago   ❤️ 1
    首先排除 DGX Spark 这类东西,因为只适合简单实验性探索,没法当生产力。
    要生产力正儿八经弄点显卡跑,看你预算了。正经想要速度和并发,投资不小。
    我 DGX Spark 单台跑了个 Qwen3.6-35B-A3B-FP8 的模型,30-50 的 tok/s 吧。
    跑 Qwen3-VL-8B-Instruct ,10-20 。效果倒是还可以,但是龟速。等完整输出完都猴年马月了。
    下了个量化过的 DeepSeek v4 flash 还没测,看测评也是 10-20 左右。
    flyico
        47
    flyico  
       1 day ago   ❤️ 1
    至少需要 70w ,不要盯着最低需求看,能吐字和能流畅的吐字完全是两种产品。
    jlkm2010
        48
    jlkm2010  
       1 day ago
    2 张昇腾 950PR 起步,最好是 4 张,如果对吞吐量要求比较高,可以搞一个 8 卡昇腾 950PR 服务器
    yiranw09
        49
    yiranw09  
    OP
       1 day ago
    @suke119 是增加 dflash 之后吗?并发效果如何?
    yiranw09
        50
    yiranw09  
    OP
       1 day ago
    @flyico 70w 大概率是超我们部门的预算了(
    提到集团公司上说不定有戏,这傻逼公司是真的抠门
    Haku
        51
    Haku  
       1 day ago via Android
    按百万算。
    不止你买硬件,后面跑起来电费,散热,维护也是一大笔开销。
    yiranw09
        52
    yiranw09  
    OP
       1 day ago
    @Jesens 上面的要求也太高了...哈,8 张 H100 ,我从哪偷啊
    dododada
        53
    dododada  
       1 day ago
    @Vveeb 理论内容如果是开放的,那值钱的除了商业机密,就是技术实施流程中的各种验证数据和验证方案了,这东西对生产制造行业来讲,就是命脉
    dododada
        54
    dododada  
       1 day ago
    好像 V 站的朋友很少和供应商打交道,渠道商肯定是缺货的,但是制造商不一定缺货啊
    yiranw09
        55
    yiranw09  
    OP
       1 day ago
    @dododada #54 到时候再拉上神通广大的商务,hhhh
    han1988
        56
    han1988  
       1 day ago
    最便宜是搞 4 张 cmp 170hx ,解锁到 40G 的就行。
    north521
        57
    north521  
       1 day ago
    两个 dgx spark 就行了,我这部署了,没问题,60 多 token/s
    bunai
        58
    bunai  
       1 day ago
    @north521 烫的起飞吧
    ZZFM
        59
    ZZFM  
       1 day ago   ❤️ 1
    用 MI300 或者 MI325 ,生产级别的硬件和代码,速度还够快,可以看看这个 https://github.com/ryanzhou/deepseek-v4-flash-mi300x
    cat9life
        60
    cat9life  
       1 day ago
    @north521 #57 两台总共 256G 显存不够的吧
    lrabbit
        61
    lrabbit  
       1 day ago
    @sky009 https://github.com/eugr/spark-vllm-docker/tree/main 吗,这个版本不会出现问题,跟官方的智商一模一样,我测试过了,其他版本可能会有点问题
    north521
        62
    north521  
       1 day ago
    @bunai #58 推理的时候七八十度
    north521
        63
    north521  
       1 day ago
    @cat9life #60 占了大概 220G
    beefhotpot
        64
    beefhotpot  
       1 day ago
    beefhotpot
        65
    beefhotpot  
       1 day ago
    #64, 八卡 5090 也能勉强跑,但是超级慢
    beefhotpot
        66
    beefhotpot  
       1 day ago
    syh2
        68
    syh2  
       1 day ago
    这种 284B 量级的模型,自己买设备,如果只走内存不走显存,貌似输出 token 特别慢,可能不一定能达到好用的要求
    superkkk
        69
    superkkk  
       22h 17m ago
    8 卡或者 4 卡的 5090 能跑 fp8 或者 nvfp4 的,或者用 2 卡 pro6000
    niubee1
        70
    niubee1  
       20h 22m ago
    自己爽跑的话,两台 DGX Spark ,要便宜可以去买微星或者技嘉的版本, 技嘉 1T 存储的版本 双机并联差不多 6 万多的成本
    zsj1029
        71
    zsj1029  
       20h 20m ago via iPhone
    h20 196g 足够,141 也能跑,一到两块就行 pcie 的卡,改个水冷就行
    niubee1
        72
    niubee1  
       20h 16m ago
    @zsj1029 H20 只有 96G 没有 196G , 你怎么看瓢了的
    beginor
        73
    beginor  
       11h 57m ago via Android
    2 张 H20(140G 版本)就可以,不过一定要有 nvlink ,我们用 4 张 H20 了,512k 上下文 10 并发,简直不要太爽
    Gnnbb
        74
    Gnnbb  
       10h 33m ago
    @Chihaya0824 #22
    为什么大佬,我们公司也是准备配 4 块 pro 6000D
    pro6000 好像是受管制
    Chihaya0824
        75
    Chihaya0824  
       10h 10m ago
    @Gnnbb BF16 over TF32 accumulation 怀疑是有 5090 一样的游戏显卡的非解锁算力,总之就是很慢
    pro 卡一般是和同 die 的游戏显卡少 2 倍的 tensor core 性能的
    Chihaya0824
        76
    Chihaya0824  
       10h 6m ago
    @Chihaya0824 游戏显卡少 2 倍的 tensor core 性能的 “游戏显卡的 2 倍的 tensor core 性能的” 打错了不好意思
    vandort
        77
    vandort  
       9h 42m ago
    @qishua 华强北魔改的
    anyinuo0413
        78
    anyinuo0413  
       9h 11m ago
    我们现在单 4090 48g 跑 qwen 3.6 量化版本…写个小工具行,稍微复杂点的得转半天…
    买了俩 48 俩 24…四张都用上也跑不了什么模型…现在跑了俩量化…一个排序一个向量… 空了一块 24 在吃灰
    clemente
        79
    clemente  
       8h 13m ago
    单张 B100 (192GB VRAM) 可以跑 NVFP4 版本的 deepseek-ai/DeepSeek-V4-Flash-0731
    clemente
        80
    clemente  
       8h 12m ago
    @vandort 别买电子垃圾 还不如 rtx6000 呢
    clemente
        81
    clemente  
       8h 3m ago
    @wwhc 满血 bf16 dtype 应该是 160Gib * 4 以上的需求 还不考虑 kv cache 的话
    clemente
        82
    clemente  
       7h 58m ago
    @vandort NV 或者 AMD 的 sdk kernel 库都是根据卡 sm 标号来的 你老卡上显存 120gb 也只能解决能跑的问题 速度天花板很低,因为 kernel 是按照 general 或者那个标号来写的
    clemente
        83
    clemente  
       7h 57m ago
    @vandort 另外游戏显卡 没有 tensor core 或者少很多。 这才是 高性能计算需要的。
    wwhc
        84
    wwhc  
       7h 48m ago
    @clemente DeepSeek 开源的是 4B 版本,也就 167GB 左右,你可到 huggingface 计算具体大小
    clemente
        85
    clemente  
       7h 40m ago
    clemente
        86
    clemente  
       7h 37m ago
    DeepSeek-V4-Pro with 1.6T parameters (49B activated) and DeepSeek-V4-Flash with 284B parameters (13B activated) — both supporting a context length of one million tokens.
    clemente
        87
    clemente  
       7h 36m ago
    @wwhc 你不妨吧链接和 readme 扔给 ai 解答一下吧
    Lazymio
        88
    Lazymio  
       7h 33m ago
    单流跑 Agent 性价比最高的感觉就是 2 台 Dgx Spark ,6 万块
    wwhc
        89
    wwhc  
       7h 21m ago
    @clemente DeppSeek 开源的是 167GB 的版本,仓库里标明了大小
    DeepSeek-V4-Flash-0731
    167 GB
    https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/tree/main
    clemente
        90
    clemente  
       5h 41m ago
    @wwhc 体积和运行时加载 vram 消耗是两回事啊
    clemente
        91
    clemente  
       5h 39m ago
    @wwhc


    对话中双方的具体错漏分析讨论角色观点/依据分析与评价 wwhc 看到 HF 文件列表总和为 167GB ,就认为只要 167GB 显存即可运行。
    概念混淆:混淆了“磁盘文件体积”与“运行时显存需求”。没有考虑到 KV Cache 、并发数( Batch Size )、上下文长度以及加载精度对显存的放大效应。



    clemente 提醒“满血 BF16 需求远超文件体积”、“运行显存还需考虑 KV Cache”。
    思路正确:深刻理解 LLM 推理的显存瓶颈不仅在 Weight ,更在于长上下文下的 KV Cache 和计算开销。
    namgking
        92
    namgking  
       5h 29m ago
    部署 0731 版本,使用的是 4 卡 H20 141GB 版本的 ,输出响应都很流畅。
    (APIServer pid=) INFO 08-07 13:33:52 [loggers.py:273] Engine 000: Avg prompt throughput: 2059.3 tokens/s, Avg generation throughput: 1343.5 tokens/s, Running: 102 reqs, Waiting: 1 reqs, GPU KV cache usage: 9.5%, Prefix cache hit rate: 94.4%
    fcten
        93
    fcten  
       5h 19m ago
    4 x 4090 48g 或者 2 x RTX PRO 6000

    上面是最低配置,如果需要 1M 上下文 + 一定数量的并发,比较建议 4 x RTX PRO 6000

    当然,预算够就推荐 4 x H20
    dbow
        94
    dbow  
       5h 18m ago
    https://v2ex.com/t/1232688 我专门开了一贴讲怎么在 dgx spark 双机上部署 deepseek v4 flash
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2859 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 161ms · UTC 11:05 · PVG 19:05 · LAX 04:05 · JFK 07:05
    ♥ Do have faith in what you're doing.